背景
记忆巩固(autoSummarize / dream)依赖 LLM 调用,属成本大头。除 #229(游标内存态 → 重启重放)外,还有两个放大成本的来源:
- 触发频率无上限:总结/巩固按事件触发,长会话内高频执行,缺少频率下限与会话次数上限;
- 无成本分级:所有待蒸馏内容一律走 LLM,没有「轻规则预判 → 才升级 LLM」的级联;高峰期(LLM 服务繁忙/配额紧张)也没有延迟到非高峰再执行的机制。
目标:减少 LLM 调用次数,且能避开高峰时段。
提案
1. 成本感知级联(论文:2608.22215 Dual-Layer Agentic Memory)
路由用「小模型先筛、大模型兜底」级联(原文 1.7B/8B,<50% 输入升级大模型)。对应到蒸馏/巩固管线:
- 蒸馏前先做零 LLM 预判:类型已知可跳过(constraint/preference 类已有独立类型)、去重命中(saveWithDedupe 三元组)、低价值条目(quality_score / importance 低于阈值)→ 直接 skip,不进 LLM;
- 只有预判「不确定 / 高价值」的才调 LLM 蒸馏。
2. 零 LLM 构建(论文:2609.05553 EdgeMem)
原子证据条目原样保留、不做生成式压缩(构建与检索全程零生成调用)。对应:原子条(evidence 层)保持原样,只有叙述条 / Primary 视图聚合时才走 LLM——从结构上减少必须调 LLM 的内容量。
3. 有界检查点(同类工具 dsh-mnemon idle review)
频率下限 + 每会话次数上限(参照其 5min 下限 + 20 次/会话上限)。对应:
summarizeMinIntervalMinutes(已存在,default 0 → 建议给合理默认值并文档化);
- 新增每会话蒸馏次数上限。
4. 错峰队列(「避开高峰期」的核心诉求)
高峰时段仅做规则预判 + 任务入队(零 LLM),LLM 蒸馏攒到配置的非高峰时段执行;或按最近调用失败 / 429 自适应退避。高峰期可配置。
5. 不确定性驱动读路径(论文:2604.00131 Oblivion,token 成本 -73%)
注入侧:确定性强的话题少召回、模糊话题多召回——降低每次对话的检索注入量。(后补项,非阻塞)
验收
参考
- 2608.22215 Dual-Layer Agentic Memory with Fast Write Routing and Slow Consolidation
- 2609.05553 EdgeMem: LLM-Free Agent Memory Construction and Retrieval via Evidence-Preserving Multi-Anchor Hypergraph
- 2604.00131 Oblivion: Self-Adaptive Agentic Memory Control through Decay-Driven Activation
背景
记忆巩固(autoSummarize / dream)依赖 LLM 调用,属成本大头。除 #229(游标内存态 → 重启重放)外,还有两个放大成本的来源:
目标:减少 LLM 调用次数,且能避开高峰时段。
提案
1. 成本感知级联(论文:2608.22215 Dual-Layer Agentic Memory)
路由用「小模型先筛、大模型兜底」级联(原文 1.7B/8B,<50% 输入升级大模型)。对应到蒸馏/巩固管线:
2. 零 LLM 构建(论文:2609.05553 EdgeMem)
原子证据条目原样保留、不做生成式压缩(构建与检索全程零生成调用)。对应:原子条(evidence 层)保持原样,只有叙述条 / Primary 视图聚合时才走 LLM——从结构上减少必须调 LLM 的内容量。
3. 有界检查点(同类工具 dsh-mnemon idle review)
频率下限 + 每会话次数上限(参照其 5min 下限 + 20 次/会话上限)。对应:
summarizeMinIntervalMinutes(已存在,default 0 → 建议给合理默认值并文档化);4. 错峰队列(「避开高峰期」的核心诉求)
高峰时段仅做规则预判 + 任务入队(零 LLM),LLM 蒸馏攒到配置的非高峰时段执行;或按最近调用失败 / 429 自适应退避。高峰期可配置。
5. 不确定性驱动读路径(论文:2604.00131 Oblivion,token 成本 -73%)
注入侧:确定性强的话题少召回、模糊话题多召回——降低每次对话的检索注入量。(后补项,非阻塞)
与 #229 的关系
验收
参考