You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
한 맥락(세션/프로젝트)에서 형성·강화된 기억이 다른 holdout 맥락에서도 유용한지 측정하는 일반화 진단 지표. 한 세션에만 과적합한 기억을 식별한다.
동기 (배경): "Feeling Social"(SNU 2025, 4-AI 적대적 검증 완료) 논문의 다중-이질-상대 fitness 가 over-specialization 을 드러낸다는 아이디어에서 영감. 단 동형(isomorphism)이 아님을 명시한다 — 논문의 변별력은 (a) 동시 평가 (b) 선호가 충돌하는 적대적 상대 (c) 진화 선택압에서 나오는데, holdout '맥락'은 적대적 평가자가 아니라 다른 질의 분포일 뿐이다. 따라서 이것은 "영합 측정기"가 아니라 맥락 일반화/과적합 진단 지표다. (선행 검토에서 generalization 에 "역-영합/사회적" 레이블을 덧씌운 과대주장을 제거함.)
기존 미구현 criterion 우선: criteria.ts:192contextDependentRetrieval(Tulving encoding specificity)이 정의만 되고 미구현. 신규 criterion 추가 전에 이것을 먼저 구현하고 holdout 변형으로 확장 가능한지 평가. 미구현 criterion 중복 추가 금지.
Design (측정 전용)
한 맥락에서 강화된 기억을 여러 holdout 맥락에서 회상 유용성으로 평가 → 일반화 점수.
calibration corpus ≠ holdout corpus 분리 — 같은 corpus 에 target 을 fit 하면 분포 과적합("과적합 측정기를 과적합으로 보정하는 재귀"). target 을 corpus-relative 백분위로 두지 않음.
Why (정직한 범위)
한 맥락(세션/프로젝트)에서 형성·강화된 기억이 다른 holdout 맥락에서도 유용한지 측정하는 일반화 진단 지표. 한 세션에만 과적합한 기억을 식별한다.
동기 (배경): "Feeling Social"(SNU 2025, 4-AI 적대적 검증 완료) 논문의 다중-이질-상대 fitness 가 over-specialization 을 드러낸다는 아이디어에서 영감. 단 동형(isomorphism)이 아님을 명시한다 — 논문의 변별력은 (a) 동시 평가 (b) 선호가 충돌하는 적대적 상대 (c) 진화 선택압에서 나오는데, holdout '맥락'은 적대적 평가자가 아니라 다른 질의 분포일 뿐이다. 따라서 이것은 "영합 측정기"가 아니라 맥락 일반화/과적합 진단 지표다. (선행 검토에서 generalization 에 "역-영합/사회적" 레이블을 덧씌운 과대주장을 제거함.)
선행 의존성 (중복 구축 금지)
local.ts:667-677) + EncodingContext.project(types.ts:80-95) 위에 얹는 역방향 reading(격리=feat(privacy): LLM 발화 차원 privacy — confidence + project scope + irrelevant isolation + PII filter #28 / 일반화=본 이슈). feat(privacy): LLM 발화 차원 privacy — confidence + project scope + irrelevant isolation + PII filter #28 G-1/G-2 구현을 prerequisite 로 링크. 독립 데이터셋 신규 구축 금지.criteria.ts:192contextDependentRetrieval(Tulving encoding specificity)이 정의만 되고 미구현. 신규 criterion 추가 전에 이것을 먼저 구현하고 holdout 변형으로 확장 가능한지 평가. 미구현 criterion 중복 추가 금지.Design (측정 전용)
calculateStrength/forget(feat(memory): 임계 망각 logic — cost 무한 도달 시 strength-weighted forget #29)/decay 가 읽지 않음. 벤치마크만 읽음. measurement ≠ reward 를 prose 가 아니라 코드 경계로.미해결 선행 과제 (착수 전 합의 필요)
가드레일
완료 판정 (객관 2건+)
contextDependentRetrieval구현 완료가 prerequisite (blocked-on 링크)우선순위
P1-P2 (prerequisite #28 + 기억분류 기준 선행).
부기 — 보류된 축 (이슈화 제외)
논문 검토 중 나온 "역-영합 strength 신호 배선"(userFeedback→strength)은 이슈화하지 않음:
DailyTurn.userFeedback(longterm/types.ts:30)는 정의만 됐고, emit 하는 collector 는 feat(benchmark): 장기 측정 framework — 사용자 daily ledger + weekly self-eval #30(naia-os#240 블록) 미구현.→ feat(benchmark): 장기 측정 framework — 사용자 daily ledger + weekly self-eval #30 collector 구현 후 naia-agent 측에서 신호 의미를 결정한 뒤 재론. 추적: 본 이슈가 feat(benchmark): 장기 측정 framework — 사용자 daily ledger + weekly self-eval #30 을 참조하므로 GitHub 가 feat(benchmark): 장기 측정 framework — 사용자 daily ledger + weekly self-eval #30 에 역참조를 남긴다 — Axis 2 재검토는 feat(benchmark): 장기 측정 framework — 사용자 daily ledger + weekly self-eval #30 하위에서 추적한다(별도 이슈 미생성).