Paired: GitHub #364 ↔ GitCode #192
价值
推理时延低:基于昇腾多级缓存与池化能力,上下文与多级KV Cache池化亲和,降低首/尾Token时延(TTFT/TTLT)
系统吞吐高:Agent 多任务管理能力, 统一CPU/NPU等资源调度,整体吞吐提升
方案
- 引入统一
KVCacheRuntime,集中管理模型 binding、父子缓存身份、在途推理及管理动作排队。
- 基于昇腾多级缓存与池化能力,上下文与多级KV Cache池化亲和,实现上下文与池化KV Cache的协同Evict/Offload/Prefetch
- 通过 Session 的
prepare_kvc()、suspend_kvc()、release_kvc() 统一生命周期入口。
- 接通 Model、ReAct、Harness 和 Team,打通 messages/tools 上下文管理。
验收要求
- KVC OFF 保留原有业务路径。
- KVC ON 正确携带
agent_hint,生命周期结束后释放对应缓存。
- 相关单元测试通过,并完成真实环境的 OFF/ON 冒烟。
Paired: GitHub #364 ↔ GitCode #192
价值
推理时延低:基于昇腾多级缓存与池化能力,上下文与多级KV Cache池化亲和,降低首/尾Token时延(TTFT/TTLT)
系统吞吐高:Agent 多任务管理能力, 统一CPU/NPU等资源调度,整体吞吐提升
方案
KVCacheRuntime,集中管理模型 binding、父子缓存身份、在途推理及管理动作排队。prepare_kvc()、suspend_kvc()、release_kvc()统一生命周期入口。验收要求
agent_hint,生命周期结束后释放对应缓存。