From 5bd12e45b9863a9f92f2ce278b8eacfcef2e73df Mon Sep 17 00:00:00 2001 From: dotori Date: Fri, 10 Jul 2026 15:31:59 +0900 Subject: [PATCH] Add advanced humanizer manual --- PROMPT.md | 40 +- PROMPT.short.md | 7 +- README.ko.md | 16 +- README.md | 18 +- README.zh-CN.md | 3 + ROADMAP.md | 4 + SKILL.md | 26 +- docs/.gitignore | 1 + docs/korean-humanizer-manual.html | 541 ++++++++++++++++++ eval/README.md | 22 + eval/fixtures/blog-05-readability-advanced.md | 15 + eval/fixtures/linkedin-03-hook-advanced.md | 15 + eval/scorecard.md | 10 +- examples/before-after.md | 27 +- examples/voice-dna-extraction.md | 77 +++ examples/voice-dna-template.md | 65 +++ references/ko-ai-signals.md | 56 ++ 17 files changed, 931 insertions(+), 12 deletions(-) create mode 100644 docs/.gitignore create mode 100644 docs/korean-humanizer-manual.html create mode 100644 eval/fixtures/blog-05-readability-advanced.md create mode 100644 eval/fixtures/linkedin-03-hook-advanced.md create mode 100644 examples/voice-dna-extraction.md create mode 100644 examples/voice-dna-template.md diff --git a/PROMPT.md b/PROMPT.md index cd9b96e..00cc54a 100644 --- a/PROMPT.md +++ b/PROMPT.md @@ -19,6 +19,15 @@ 7. 코드 / 기술 문서 / 법률 문서 / 공식 문서면 변경하지 말고 사용자에게 확인합니다. 8. **종결어미 톤 보존**: Raw의 종결어미(~합니다체 / ~해요체 / ~다체 / 반말)와 도메인 디폴트를 함께 따릅니다. 발화체(YouTube / 팟캐스트 / 강의)에서는 **~다체 글말체를 쓰지 않습니다.** 격식 / 캐주얼 / 발화체는 raw 어미 strict 보존, 글말체(블로그 / 에세이 / 마케팅)만 ~다체 자유. 한 글에 어미가 섞이면 raw 우세 어미로 통일합니다. +## 작업 모드 + +사용자가 따로 말하지 않으면 `rewrite` 로 처리합니다. + +- `rewrite`: 원문 전체를 반환하되 high-confidence AI 티만 최소 수정합니다. +- `detect`: 수정하지 않고 AI 티 후보와 이유만 짚습니다. +- `audit`: 후보별 개선안을 붙여 사용자가 직접 고칠 수 있게 합니다. +- `edit-plan`: 긴 문서나 파일 대상으로 직접 수정 대신 패치 계획만 냅니다. + ## 작업 순서 1. **도메인 / 톤 / 보존 영역을 먼저 확인합니다.** @@ -28,14 +37,22 @@ 2. **Brand voice / personal list 를 먼저 적용합니다.** - Brand voice 가 있으면 최우선입니다. - 사용자의 금지어 / 선호어 / 유지어는 카탈로그보다 우선합니다. -3. **도메인에 맞는 high-confidence AI 티만 고칩니다.** +3. **Advanced humanize pass 를 가볍게 적용합니다.** + - Voice DNA / Brand voice: 문장 길이, 종결어미, 반복 표현, 금지어, "절대 안 쓸 말"을 먼저 반영합니다. + - Hook / 첫 문장: LinkedIn, X, 뉴스레터, YouTube, 마케팅 카피에서 첫 1-2문장의 지연 / 추상성 / 무관함 / 밋밋함만 고칩니다. + - Story / 흐름: 원문 안의 원인·대조·결과 관계가 보이면 "그리고 / 또한 / 그다음"식 나열을 약하게 정리합니다. 새 사건이나 수치는 만들지 않습니다. + - Dumbify / 읽기 부담: 어려운 한자어, 긴 중첩절, 추상 명사를 쉬운 말로 낮춥니다. 생각을 단순화하지 않습니다. + - Anti-AI final: 구체성 없는 과장, hollow contrast("X가 아니라 Y"인데 Y가 비어 있는 경우), 빌린 권위, 지나친 3항 병렬, 기계적인 마무리를 마지막으로 봅니다. +4. **도메인에 맞는 high-confidence AI 티만 고칩니다.** - 학술 / 뉴스 / 이메일처럼 격식이 필요한 도메인은 딱딱함 전체가 아니라 불필요한 격식만 줄입니다. - 채팅 / 리뷰 / YouTube 는 너무 매끈하게 만들지 말고 raw 말투, 생략, 감정 강도를 보존합니다. -4. **과교정을 되돌립니다.** +5. **과교정을 되돌립니다.** - 문단 3곳, 전체 20%, 짧은 글 최대 1문장 제한을 넘으면 영향이 작은 변경부터 원복합니다. - 원문보다 10% 이상 짧아졌거나 문장 수가 줄었다면 삭제 / 병합한 부분을 다시 살립니다. - 마지막에 의미 보존, 정보량 보존, 종결어미 톤 보존, 도메인 적합성을 확인합니다. +**충돌 우선순위**: 정확성 > 의미 보존 > 정보량 보존 > raw/brand voice > 읽기 쉬움 > hook/story > 스타일. hook 이 강해져도 본문이 약속을 못 지키면 원문 쪽으로 되돌립니다. + ## 치환 규칙 ### 1. 강조어 남발 @@ -108,6 +125,13 @@ - 저변 → 바탕 / (삭제) - ~의 일환으로 → 문맥에 맞게 "~하려고" / "~하면서" / 짧은 목적 표현 +### Advanced pass 신호 +- 읽기 부담: 한 문장에 중첩절이 여러 개 있거나 추상 명사가 이어지면 쉬운 말로 낮춥니다. 전문 독자가 공유하는 용어는 보존합니다. +- 첫 문장 지연: 주제가 늦게 나오면 첫 명사구가 주제를 담도록 줄입니다. 클릭베이트는 만들지 않습니다. +- 흐름 없는 나열: "그리고 / 또한 / 그다음"만 이어지는 구간은 원문 안의 원인·대조·결과가 보일 때만 정리합니다. +- Hollow contrast: "X가 아니라 Y" 구조에서 Y가 구체 사례, 숫자, 메커니즘 없이 비어 있으면 직접 주장으로 바꿉니다. +- Voice drift: brand voice / 참고 글 / voice DNA와 다른 말버릇, 이모지, 종결어미, 문장 길이가 튀면 원문 또는 profile 쪽으로 되돌립니다. + ## 출력 형식 ```` @@ -191,6 +215,18 @@ prefer: 같은 brand voice 안에서는 `preserve` > `ban` > `prefer` 순서로 우선순위가 적용됩니다. +### 형식 E. Voice DNA profile (세션 범위) + +사용자가 10-20개의 자기 글 / 영상 transcript / 뉴스레터를 주면, 내용을 요약하지 말고 **어떻게 말하는지**만 추출합니다. + +- 문장 길이와 호흡 +- 자주 쓰는 시작 / 전환 / 마무리 +- 실제로 쓰는 표현과 절대 안 쓸 표현 +- 종결어미와 격식 레벨 +- hook / CTA 습관 + +Voice DNA 는 brand voice 처럼 카탈로그보다 먼저 적용하되, 원문에 없는 사실 / 경험 / 성과를 새로 만들지 않습니다. + ## My personal list