Skip to content

[Feature]: agent-memory记忆安全防护优化:脱敏、投毒、密态 #404

Description

🚀 背景描述

1、监管驱动:上级对部署记忆服务有安全审查要求。金监总局《指导意见》与 9 月发布的《人工智能安全治理框架 3.0》均明确提出"记忆安全"相关要求,记忆系统作为智能体的长期状态载体,已纳入AI 应用安全审查范围。

2、记忆风险主要存在如下:
(1)记忆污染。智能体将恶意指令、错误信息等内容写入长期记忆,持续影响后续决策。
(2)记忆窃取。智能体长期记忆被越权访问,导致特定敏感信息泄露,或重要数据被窃取。

3、当前记忆服务(V0.2.0beta)已提供初步存储安全能力,但安全基础薄弱,用于核心业务投产前存在如下问题:
(1)存储明文落盘:KV 与文件系统中的记忆数据(含用户对话敏感信息)未加密,不满足数据静态加密要求;
(2)记忆内容源于用户对话与业务数据,核心业务场景必然沉淀个人信息(卡号、证件号、手机号等)与商业敏感数据,无敏感数据识别能力,无法在写入、召回、日志各环节自动发现敏感数据且存在无脱敏策略配置,是本次安全审查的硬性卡点
(3)无法防御持合法身份的恶意写入:被入侵的 Agent 可凭合法委托身份批量写入污染数据

设计思路

(1)敏感数据识别:内置金融行业识别规则(正则 + NER:证件号、卡号、手机号、地址等),支持租户自定义规则扩展;

(2)写入侧脱敏:在加密前执行识别与脱敏(掩码、泛化、假名化、Token 化),支持"脱敏后存储"与"标记存储 + 使用时脱敏"两种策略

(3)日志与审计脱敏:审计事件、运行日志不落敏感明文;

(4)写入侧内容安全网关:对写入记忆的内容执行注入检测、有害内容识别、质量评估,支持"放行 / 打标隔离 / 拦截"三级处置;

(5)记忆来源溯源:记录写入者、写入时间、来源会话,支持污染回溯与影响面评估;
记忆健康巡检:后台定期扫描异常模式(同一来源短时间大量写入、相似内容异常聚集等),产生告警;

(6)提供 EncryptedKVStore、EncryptedFSStore 加密装饰器,对现有存储透明叠加静态加密;加密 KV list 在解密后执行过滤、计数、排序和分页,保证密文能力不损失

涉及到的对外API

新增脱敏策略配置接口、脱敏规则管理、记忆可信级查询/调整、健康巡检触发与结果查询、记忆批量隔离/清除接口;变更 write/search/list/get 行为(按策略脱敏)、记忆写入接口(返回内容安全处置结果)

与其他模块的相关性描述

影响记忆写入模块、记忆召回模块

测试设计与测试计划

1、攻击测试:提示注入样本库攻击测试、污染扩散验证;
2、性能基线:脱敏对写入/召回链路的时延损耗基线、百万级记忆规模下健康巡检扫描开销基线;
3、效果评估:敏感数据识别准确率/召回率基线,脱敏后记忆可用性(召回质量)评估、误杀率评估、处置与审计联动验证。
4、联动测试:策略与权限联动、日志与审计无明文敏感数据扫描

其他信息

感谢您的贡献 🎉!

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions