You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
reacted with thumbs up emoji reacted with thumbs down emoji reacted with laugh emoji reacted with hooray emoji reacted with confused emoji reacted with heart emoji reacted with rocket emoji reacted with eyes emoji
Uh oh!
There was an error while loading. Please reload this page.
这是 #324 Skill 正文该何时加载、压缩后如何恢复 的治理后续。
#324 解决了一个运行时问题:Skill 正文什么时候进入 context,发生 compaction 或 resume 后怎样重新投影。随着 Skill 数量增加,还需要单独讨论它们进入投影之前和离开投影之后的生命周期。
一个 Skill 可能仍然写得正确,却因为描述和用户实际说法逐渐偏离而再也不会被触发。另一个 Skill 可能被 Runtime 找到并加载了,但模型没有遵循其中的关键规则。还有一些 Skill 只需要测试或更新,却可能被一次启发式清理直接标成退休。
OpenAI Codex #41635 给出了一个具体切口。该讨论提出对
AGENTS.md、CLAUDE.md和SKILL.md做本地只读审计,并把MERGE、UPDATE、DEMOTE、RETIRE和TEST分开。讨论还指出,TEST不等于RETIRE。如果宿主没有可靠的 Skill load event,就不能把“没有观察到加载”推断为 unused。本帖希望讨论一套很小的生命周期合同,不增加另一种 Skill 文件格式。
当前缺口
当前几个事实经常被混在一起:
这些事实不应互相推断。尤其在没有可靠事件时,结果应为
UNKNOWN,不能把 unknown 当成 unused 或RETIRE。建议区分的状态
found索引或搜索找到了 Skill。
loadedRuntime 把 Skill 放进了当前 context 或 capability projection。
used本次执行实际引用了它提供的内容或能力。
followed执行结果有证据表明相关规则被遵守。
verifiedSkill 的引用、版本、宿主兼容范围和行为测试仍然有效。
最小记录
每个 Skill 或 instruction 可以先拥有以下元数据:
审计器可以产生
STALE_REFERENCE、DUPLICATE、TRIGGER_UNCOVERED、LOAD_UNKNOWN、TEST_REQUIRED和RETIRE_CANDIDATE。这些结果不应合并成一个健康度分数,也不应直接触发删除。建议的治理边界
load_evidence只能说明内容进入了 Runtime,不能自动证明模型遵循了规则;adherence_evidence应尽量绑定到可观察的 Runtime action、validator 或 negative test,而不是只看最终文本;TEST或UPDATE,保留人工批准DEMOTE和RETIRE的边界。最小可证伪实验
为一个 Skill 准备两个真实触发说法、一个近邻但不应触发的说法,以及一个需要执行验证的规则。分别测试:
UNKNOWN;TEST、UPDATE、DEMOTE和RETIRE是否保留可回滚记录。与现有工作的关系
#324 讨论 Skill 的发现、读取、compaction 和 resume;这里新增的是内容健康、触发覆盖、遵循证据和治理动作之间的边界。它也不要求 OpenPI 现在判断所有自然语言规则是否被完美遵循。
非目标
希望讨论的问题
found、loaded、used、followed各自需要什么最低证据?UNKNOWN应如何影响清理、评测和后续加载?TEST/UPDATE/DEMOTE/RETIRE,谁应批准,旧版本和回滚信息应保存多久?希望讨论最终回答:
All reactions