Skip to content

[Feature] 巩固/总结的高峰感知调度:成本感知级联 + 有界检查点 + 错峰队列 #239

Description

@modusensus

背景

记忆巩固(autoSummarize / dream)依赖 LLM 调用,属成本大头。除 #229(游标内存态 → 重启重放)外,还有两个放大成本的来源:

  1. 触发频率无上限:总结/巩固按事件触发,长会话内高频执行,缺少频率下限与会话次数上限;
  2. 无成本分级:所有待蒸馏内容一律走 LLM,没有「轻规则预判 → 才升级 LLM」的级联;高峰期(LLM 服务繁忙/配额紧张)也没有延迟到非高峰再执行的机制。

目标:减少 LLM 调用次数,且能避开高峰时段。

提案

1. 成本感知级联(论文:2608.22215 Dual-Layer Agentic Memory)

路由用「小模型先筛、大模型兜底」级联(原文 1.7B/8B,<50% 输入升级大模型)。对应到蒸馏/巩固管线:

  • 蒸馏前先做零 LLM 预判:类型已知可跳过(constraint/preference 类已有独立类型)、去重命中(saveWithDedupe 三元组)、低价值条目(quality_score / importance 低于阈值)→ 直接 skip,不进 LLM;
  • 只有预判「不确定 / 高价值」的才调 LLM 蒸馏。

2. 零 LLM 构建(论文:2609.05553 EdgeMem)

原子证据条目原样保留、不做生成式压缩(构建与检索全程零生成调用)。对应:原子条(evidence 层)保持原样,只有叙述条 / Primary 视图聚合时才走 LLM——从结构上减少必须调 LLM 的内容量。

3. 有界检查点(同类工具 dsh-mnemon idle review)

频率下限 + 每会话次数上限(参照其 5min 下限 + 20 次/会话上限)。对应:

  • summarizeMinIntervalMinutes(已存在,default 0 → 建议给合理默认值并文档化);
  • 新增每会话蒸馏次数上限。

4. 错峰队列(「避开高峰期」的核心诉求)

高峰时段仅做规则预判 + 任务入队(零 LLM),LLM 蒸馏攒到配置的非高峰时段执行;或按最近调用失败 / 429 自适应退避。高峰期可配置。

5. 不确定性驱动读路径(论文:2604.00131 Oblivion,token 成本 -73%)

注入侧:确定性强的话题少召回、模糊话题多召回——降低每次对话的检索注入量。(后补项,非阻塞)

#229 的关系

验收

  • 蒸馏前置零 LLM 预判生效(日志可见 skip 原因统计)
  • 高峰时段 LLM 调用为 0,任务入队并在非高峰执行
  • 每会话蒸馏次数有上限、可配置
  • 默认配置下 LLM 调用量较现状可量化下降

参考

  • 2608.22215 Dual-Layer Agentic Memory with Fast Write Routing and Slow Consolidation
  • 2609.05553 EdgeMem: LLM-Free Agent Memory Construction and Retrieval via Evidence-Preserving Multi-Anchor Hypergraph
  • 2604.00131 Oblivion: Self-Adaptive Agentic Memory Control through Decay-Driven Activation

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions