Skip to content

引入上下文长度无关的 decode CUDA Graph 路径 - #28

Merged
kuma-loong merged 22 commits into
mainfrom
refactor/new-agents-md
Aug 26, 2026
Merged

引入上下文长度无关的 decode CUDA Graph 路径#28
kuma-loong merged 22 commits into
mainfrom
refactor/new-agents-md

Conversation

@kuma-loong

Copy link
Copy Markdown
Collaborator

背景

现有 decode CUDA Graph 同时按 batch size 和 context length 建图,有限图预算需要在两个维度间分配。该变更增加实验性的上下文长度无关路径,使图预算可以集中覆盖 batch size,并保留原实现作为回退。

主要改动

  • 增加有界预捕获和 batch-only decode graph 策略,完善捕获配置、调度与运行时状态输出。
  • 新增独立的上下文长度无关 attention provider 和 Triton kernel,不覆盖原有算子。
  • 覆盖通用 decode attention、MLA、Gemma 4 和 Qwen 3.5;对尚未验证的稀疏方法显式拒绝 batch-only graph。
  • 修正二维 attention score 归约、TP 配置及不同设备上的 Gemma 4 decode 稳定性与 split 调优。
  • 扩展 benchmark probe、效率指标和相关单元测试。

兼容性与回退

  • 新路径通过配置启用,原有 context-aware graph 与 attention provider 保持可用。
  • provider 在图捕获前完成选择,forward 热路径不增加动态实现切换。
  • 不满足已验证运行时约束时显式报错,避免静默产生错误结果。

验证

  • 增加 CUDA Graph、通用 decode attention、MLA、Gemma 4、Qwen 3.5、benchmark contract 和稀疏状态相关测试。
  • 已通过提交内容隐私扫描和 git diff --check。

后续

该实现暂作为实验功能。后续将在统一硬件和匹配 workload 下,对比 context-aware 与 batch-only graph 的端到端吞吐、延迟、显存占用和算子开销,再决定默认策略与图预算分配。

@kuma-loong
kuma-loong force-pushed the refactor/new-agents-md branch 4 times, most recently from c2a3019 to 2a2782b Compare August 25, 2026 14:11
@kuma-loong
kuma-loong force-pushed the refactor/new-agents-md branch from 299b754 to e47c689 Compare August 26, 2026 11:27
@kuma-loong
kuma-loong merged commit 6bd18ae into main Aug 26, 2026
1 of 2 checks passed
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant