Skip to content

feat(benchmark): cross-context generalization 진단 지표 (측정 전용) #37

Description

@luke-n-alpha

Why (정직한 범위)

한 맥락(세션/프로젝트)에서 형성·강화된 기억이 다른 holdout 맥락에서도 유용한지 측정하는 일반화 진단 지표. 한 세션에만 과적합한 기억을 식별한다.

동기 (배경): "Feeling Social"(SNU 2025, 4-AI 적대적 검증 완료) 논문의 다중-이질-상대 fitness 가 over-specialization 을 드러낸다는 아이디어에서 영감. 단 동형(isomorphism)이 아님을 명시한다 — 논문의 변별력은 (a) 동시 평가 (b) 선호가 충돌하는 적대적 상대 (c) 진화 선택압에서 나오는데, holdout '맥락'은 적대적 평가자가 아니라 다른 질의 분포일 뿐이다. 따라서 이것은 "영합 측정기"가 아니라 맥락 일반화/과적합 진단 지표다. (선행 검토에서 generalization 에 "역-영합/사회적" 레이블을 덧씌운 과대주장을 제거함.)

선행 의존성 (중복 구축 금지)

Design (측정 전용)

  • 한 맥락에서 강화된 기억을 여러 holdout 맥락에서 회상 유용성으로 평가 → 일반화 점수.
  • calibration corpus ≠ holdout corpus 분리 — 같은 corpus 에 target 을 fit 하면 분포 과적합("과적합 측정기를 과적합으로 보정하는 재귀"). target 을 corpus-relative 백분위로 두지 않음.
  • 모듈 경계 강제: holdout 점수는 calculateStrength/forget(feat(memory): 임계 망각 logic — cost 무한 도달 시 strength-weighted forget #29)/decay 가 읽지 않음. 벤치마크만 읽음. measurement ≠ reward 를 prose 가 아니라 코드 경계로.

미해결 선행 과제 (착수 전 합의 필요)

가드레일

  • measurement ≠ reward (모듈 경계). homeostasis set-point = 기억 정합성(contradiction-filter), 사용자 만족 아님.
  • No Magic Numbers / Scale Verification(100k) / F-MEM-06 준수.

완료 판정 (객관 2건+)

  1. feat(privacy): LLM 발화 차원 privacy — confidence + project scope + irrelevant isolation + PII filter #28 G-axis + contextDependentRetrieval 구현 완료가 prerequisite (blocked-on 링크)
  2. calibration/holdout corpus 분리 하네스 + baseline 리포트
  3. holdout 점수가 strength/forget 경로에서 읽히지 않음을 보장하는 경계 테스트

우선순위

P1-P2 (prerequisite #28 + 기억분류 기준 선행).


부기 — 보류된 축 (이슈화 제외)

논문 검토 중 나온 "역-영합 strength 신호 배선"(userFeedback→strength)은 이슈화하지 않음:

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    P2개선·측정·후순위

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions