Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
6 changes: 6 additions & 0 deletions .gitignore
Original file line number Diff line number Diff line change
Expand Up @@ -38,3 +38,9 @@ Thumbs.db

# Do not commit evaluation archives (released as separate tarballs)
archives/

# DeepSeek anchoring experiment: private sessions, credentials, and sandbox jobs
evaluator/trajectory_evidence/raw/
experiments/deepseek-v4-pro-anchoring/private/
experiments/deepseek-v4-pro-anchoring/jobs/
experiments/deepseek-v4-pro-anchoring/.env
12 changes: 10 additions & 2 deletions README.md
Original file line number Diff line number Diff line change
Expand Up @@ -12,8 +12,7 @@ PR 一致性预审。

- **当前正式稳定基线:V4.1b**,已于 2026-07-23 正式冻结。不再迭代、不开发 V5。
详见 [`PROJECT_FROZEN.md`](./PROJECT_FROZEN.md)。
- 冻结的是题面、测试与计分规则;模型、渠道和 harness 的实测台账仍会追加。
最新一轮记录截至 2026-08-14。
- 冻结的是题面、测试与计分规则;模型、渠道和 harness 的实测台账仍会追加。维护者原始记录截至 2026-08-14;2026-08-15 新增 [@NineThoughts0521](https://github.com/NineThoughts0521) 的独立复现补充,不并入维护者 formal `n`。
- 这是一个**个人项目**,不是面向社区的公开 benchmark;Ability 阈值与结论只对本
题面、本工具环境有效,**不构成跨项目通用认证**。
- V5 两次尝试均失败,工作区与归档见独立 repo **`modeltest-v5`**。
Expand All @@ -38,6 +37,13 @@ PR 一致性预审。
| DeepSeek V4 Pro / 正式 DSH minimal | **99, 96** | 正式版在 RL 对齐 scaffold 下复现 |
| DeepSeek V4 Pro / DSH anchored-standard | **98, 99** | Windows 两阶段目录;完整 Standard 工具可用 |

### 独立第三方复现(2026-08-15,不并入 formal n)

[@NineThoughts0521](https://github.com/NineThoughts0521) 在同一 frozen Project2 V4.1b、DeepSeek V4 Pro、reasoning `max` 下完成 DSH Anchored Standard / Standard / Minimal-Full 三枪和一枪 OpenCode exploratory replacement。独立 Ability 为 **96 / 89 / 85.5 / 93**;其中 Anchored 相对同批 Standard 为 `+7`,相对 Minimal-Full 为 `+10.5`。该结果 supports 首请求工具目录具有额外贡献,并与维护者原 Anchored 高于 Standard 的方向 consistent with;它不追加到上表 `n`,也不证明跨任务普适因果。

- **独立复现报告:** [`DeepSeek V4 Pro 首请求工具目录锚定:独立复现与 full-task 消融`](./docs/v4.1/DEEPSEEK_V4_PRO_INDEPENDENT_REPLICATION_20260815.md)
- **预注册、runner 与公开证据:** [`experiments/deepseek-v4-pro-anchoring/`](./experiments/deepseek-v4-pro-anchoring/README.md)

因此可以说,**V4 Pro 的已观测能力上限在本题上确实进入了 Fable 5、Opus 5 和 Sol
的同一顶端分数带**;这不是跨任务通用等价证明,也不能证明灰测实际代理了任何 Claude
后端。
Expand Down Expand Up @@ -200,6 +206,8 @@ python evaluator\prepare_candidate_handoff.py
[`docs/v4.1/DEEPSEEK_V4_TRAJECTORY_ANALYSIS_20260814.md`](./docs/v4.1/DEEPSEEK_V4_TRAJECTORY_ANALYSIS_20260814.md)
- DeepSeek V4 Pro / Flash 触发机制实验:
[`docs/v4.1/DEEPSEEK_V4_TRIGGER_MECHANISM_EXPERIMENTS_20260814.md`](./docs/v4.1/DEEPSEEK_V4_TRIGGER_MECHANISM_EXPERIMENTS_20260814.md)
- DeepSeek V4 Pro 独立复现与 Minimal-Full full-task 消融(不并入维护者 formal `n`):
[`docs/v4.1/DEEPSEEK_V4_PRO_INDEPENDENT_REPLICATION_20260815.md`](./docs/v4.1/DEEPSEEK_V4_PRO_INDEPENDENT_REPLICATION_20260815.md)
- 最终评估与使用阈值:[`docs/v4.1/FINAL_ASSESSMENT_20260719.md`](./docs/v4.1/FINAL_ASSESSMENT_20260719.md)
- 轮次事实终稿:[`docs/v4.1/ROUND_SUMMARY_20260719.md`](./docs/v4.1/ROUND_SUMMARY_20260719.md)
- 评分面冻结哈希:[`evaluator/reports/v4.1b_freeze_manifest.md`](./evaluator/reports/v4.1b_freeze_manifest.md)
Expand Down
8 changes: 8 additions & 0 deletions docs/v4.1/DEEPSEEK_V4_PRO_HARNESS_ANALYSIS_20260814.md
Original file line number Diff line number Diff line change
Expand Up @@ -251,6 +251,14 @@ standard/PTC 对照已关闭 OS、官方 harness 和推理档位三个主要混
更宽的 agent 接口下明显退化,说明它具备较高能力上限,同时存在强接口依赖和较弱的工具
策略泛化。**

## 2026-08-15 第三方独立复现附录

[@NineThoughts0521](https://github.com/NineThoughts0521) 在相同 frozen Project2 V4.1b task 上,使用 DSH `0.1.0-rc.6`、DeepSeek V4 Pro `max` 和同一 evaluator 完成了一次预注册机制消融:Anchored Standard `96`、Standard `89`、新增 Minimal-Full `85.5`。这三枪属于独立第三方证据,不追加到维护者原有 formal `n`、主榜排名、worst、均值或样本索引。

Minimal-Full 保留 Anchored 的 Minimal complete system condition、`complete: true`、`includeRuntimeContext: false` 和 Standard capability roster,但从 request 1 暴露完整 25 项工具;Anchored request 1 仅暴露 `pwsh/read`,首次 durable tool call 后恢复相同完整目录。静态 schema gate 通过,因此本批次观察到 Standard → Minimal-Full `-3.5`、Minimal-Full → Anchored `+10.5`,结果 **supports** 首请求工具目录具有额外贡献,并与维护者 Anchored 优于 Standard 的方向 **consistent with**。不过 Anchored 还包含目录 transition 及其时序,单次同题运行不能把它们拆成唯一变量,也不能证明跨任务普适因果。

同批次的 OpenCode `1.18.17` replacement 得到 `93`,但它是 post-preregistered exploratory harness comparison;原 partial 永久保留为不计分 infrastructure failure,二者都不进入 DSH mechanism ablation。完整结果、成本、轨迹聚合、工具目录快照和公开/私有证据边界见 [`DEEPSEEK_V4_PRO_INDEPENDENT_REPLICATION_20260815.md`](./DEEPSEEK_V4_PRO_INDEPENDENT_REPLICATION_20260815.md)。

## 证据索引

- 灰测:[20260718_212524 / 99](../../evaluator/reviews/v4.1b_DeepSeek-V4-Pro_opencode_20260718_212524.md)、
Expand Down
101 changes: 101 additions & 0 deletions docs/v4.1/DEEPSEEK_V4_PRO_INDEPENDENT_REPLICATION_20260815.md
Original file line number Diff line number Diff line change
@@ -0,0 +1,101 @@
# DeepSeek V4 Pro 首请求工具目录锚定:独立复现与 full-task 消融

**日期:** 2026-08-15 · **独立复现者:** [@NineThoughts0521](https://github.com/NineThoughts0521) · **上游目标:** `xiaobright/modeltest`

**统计边界:** 本报告是第三方独立证据;下列 runs 不并入维护者原有 formal `n`、主榜排名、worst、均值或样本索引。

## 摘要

在固定 Project2 V4.1b、DeepSeek V4 Pro、reasoning `max` 和 DSH `0.1.0-rc.6` 下,本轮依次运行 Anchored Standard、Standard 与新增的 Minimal-Full。三枪 Ability 分别为 **96、89、85.5**。同一次静态 schema gate 证明 Minimal-Full 与 Anchored 的 Minimal complete system condition 和首请求非工具字段相同,Minimal-Full 从 request 1 起暴露完整 25 项 Standard 工具,而 Anchored 首请求仅暴露 `pwsh/read`,首次 durable tool call 后恢复相同的完整目录。

这组单次观测 **supports** 首请求工具目录与 Project2 表现之间存在独立关联,并与维护者原有 Anchored Standard 高于 Standard 的方向 **consistent with**。它没有证明普适因果:每个条件只有一枪,全部使用同一题面,且 Anchored treatment 同时包含窄首请求与随后目录 transition 的时序。外部 benchmark 未在本阶段执行,因此跨任务迁移仍未得到验证。

## 与维护者结果的边界

维护者原报告中的 DSH Anchored Standard `98/99`、Minimal `99/96`、Standard `91` 和其他 DeepSeek 样本保持原统计口径。本轮 Anchored `96` 是 [@NineThoughts0521](https://github.com/NineThoughts0521) 在独立环境中的单次复现,不追加到原 `n=2`,也不改变 scoreboard 的 worst、均值或排名。

独立 Anchored 分数低于维护者两枪,但相对同一独立批次 Standard 的差值为 `+7`,方向与维护者原观察一致。该关系比跨操作者直接比较绝对分数更有信息量,但仍只适用于当前 frozen task 和运行条件。

## 固定条件

| 项目 | 固定值 |
|---|---|
| modeltest base | `04255b55f16c4439e538239fb9783070c4165081` |
| benchmark / task | `project2-v4.1b` / `project2-v4-broken-seed` |
| candidate prompt SHA-256 | `576103f9a5a7a619c0669674cf384a975b89390bb034c368a53a148251f2df84` |
| model / provider | `deepseek-v4-pro` / `deepseek-official` |
| reasoning | `max` |
| DSH | `0.1.0-rc.6` / source commit `47f943859bef60e4160492346772ded9b24f765a` |
| endpoint | `https://api.deepseek.com` |
| evaluator | 原 V4.1b public/debug/hidden/ESP static/scorer;未运行 optional real ESP-IDF build |
| execution | 串行、每枪前 reset、结果无关重跑禁止 |

正式顺序为 Anchored Standard、Standard、Minimal-Full。OpenCode comparison 只在三枪 DSH 完成后运行,并明确排除在 DSH mechanism ablation 之外。

## Project2 3+1 结果

| Harness / preset | Ability | Ship | Class | Hidden | ESP static | F9 | 账户成本 | model wall time |
|---|---:|---:|---|---|---|---|---:|---:|
| DSH Anchored Standard | **96** | 96 | A | 44/45 | 9/9 | 3/6 `skipped_env` | ¥2.58 | 35m41s |
| DSH Standard | **89** | 89 | B+ | 43/45 | 7/9 | 3/6 `skipped_env` | ¥1.64 | 27m33s |
| DSH Minimal-Full | **85.5** | 85.5 | B+ | 42/45 | 6/9 | 3/6 `skipped_env` | ¥1.13 | 11m45s |
| OpenCode 1.18.17 replacement | **93** | 93 | B+ | 43/45 | 8/9 | 3/6 `skipped_env` | ¥1.53 | 21m33s |

四个有效 run 的账户成本为 ¥6.88;保留但不计分的 OpenCode partial 另消耗 ¥0.24,因此本阶段总账户成本为 **¥7.12**。按每枪运行时官方人民币单价复算的总 usage 成本为 **¥7.075304**。详细 token、balance window 和复算差异见实验目录的 machine-readable aggregate。

## Minimal-Full 消融

Minimal-Full 复制 Anchored Standard 的 Minimal complete system condition、`complete: true`、`includeRuntimeContext: false` 与 Standard capability roster,仅移除 `tool-bootstrap`。零费用 mock gate 得到以下断言:

| 断言 | 结果 |
|---|---|
| Minimal-Full request 1 工具 schema = Standard request 1 | pass |
| Minimal-Full request 1 工具 schema = Anchored request 2 | pass |
| Minimal-Full system = Anchored system | pass |
| Minimal-Full 与 Anchored request 1 非工具字段相同 | pass |
| Anchored request 1 仅 `pwsh/read` | pass |
| Anchored request 2 恢复完整 25 项目录 | pass |

Standard 到 Minimal-Full 的 Ability 变化为 `-3.5`,Minimal-Full 到 Anchored 为 `+10.5`,Standard 到 Anchored 为 `+7`。在这一次任务上,Minimal complete scaffold 本身没有解释 Anchored 的提升;观察结果 **supports** first-request tool-schema anchoring 具有独立贡献的解释。

该 A/B 的模型可见首请求差异经过 hash gate 收窄到工具目录,但 treatment 不只是“工具数量”这个静态变量,还包括 Anchored 在首次 durable tool call 后发生的目录 transition 及其时序。当前证据没有进一步拆分工具名称、描述、顺序或 transition 边界,也没有提供多 seed 方差估计。

## Trajectory fingerprints

| Harness / preset | Ability | reasoning blocks | `we` | `let me` | `let's` | visible replies | tool calls |
|---|---:|---:|---:|---:|---:|---:|---:|
| DSH Anchored Standard | 96 | 191 | 324 | 31 | 167 | 1 | 244 |
| DSH Standard | 89 | 88 | 25 | 149 | 2 | 41 | 166 |
| DSH Minimal-Full | 85.5 | 47 | 67 | 14 | 16 | 8 | 83 |
| OpenCode replacement | 93 | 65 | 22 | 119 | 3 | 35 | 152 |

这些统计只作为行为指纹。Anchored 的 `we`/`let's` 增多、可见阶段回复减少,与维护者报告的 minimal-like 方向 consistent with;但本批次 Minimal-Full 也有较少 `let me` 而得分最低,进一步说明措辞风格不是能力指标,也不是因果证据。

## OpenCode partial 与 replacement

最初的 `P2-20260815-04-opencode` 在模型已响应且进程仍活动时受到外层 hosting tool session 中断。该 run 永久登记为 `infrastructure_failed_partial_after_model_response`,不计 benchmark score,不从中恢复继续执行,也不因结果重跑;¥0.24 计入总成本。private export 含 11 个 reasoning blocks 和 22 个 tool calls,event stream 记录 23 个 completed tool events 并留下 pending final tool,两种计数按来源分别保留。

经操作者明确批准后执行一次 `P2-20260815-04b-opencode-replacement`。replacement 固定 OpenCode `1.18.17` commit `02546dfc2e4515a4f90aaf9ceb3890df2ac2b479`、direct DeepSeek provider、`deepseek-v4-pro`、`--variant max`、官方 endpoint、同一 prompt/evaluator;只把进程改为 detached/background 生命周期。它以 exit `0` 完成并得到 `93/93/B+`,无论该结果高低都未再运行。该行只用于 exploratory harness comparison,不进入前三枪因果消融。

## 证据与隐私

公开目录包含 preregistration、run matrix、preset/config、schema gate、原 evaluator 派生结果、trajectory aggregate、token/time/cost aggregate、balance window hash、request tool-catalog snapshot、infrastructure event 和 SHA-256 manifest。完整 DSH session JSONL、OpenCode export/event stream、reasoning/CoT、credentials 与私人绝对路径保留在本地且由 Git ignore。

主要入口:

- [实验 README](../../experiments/deepseek-v4-pro-anchoring/README.md)
- [完整结果表](../../experiments/deepseek-v4-pro-anchoring/RESULTS.md)
- [machine-readable comparison](../../experiments/deepseek-v4-pro-anchoring/artifacts/comparison.json)
- [public/private evidence SHA-256 manifest](../../experiments/deepseek-v4-pro-anchoring/artifacts/evidence-manifest.json)
- [Minimal-Full preset](../../tools/deepseek-harness-presets/minimal-full/agent.cordis.yml)

## 限制

- 每个有效条件只有一枪,不能据此估计方差或统计显著性。
- 全部能力结果来自同一个 Project2 task;DeepSWE 与 Terminal-Bench 未运行,跨任务问题仍开放。
- 运行按预注册顺序串行执行,不能完全排除时间漂移、provider 负载或顺序效应。
- Project2 未运行 optional real ESP-IDF build,所有行 F9 均为 `3/6 skipped_env`。
- OpenCode 工具目录证据来自 pinned static agent resolution,不是 HTTP wire capture。
- balance delta 与 usage 复算保留各自语义,未把差异静默分配给任一请求。

因此,本轮最克制的结论是:**独立 Project2 结果 supports first-request tool-schema anchoring 具有额外贡献,并与维护者原 Anchored 优于 Standard 的方向 consistent with;它尚未证明该效应能跨任务、跨版本或跨 provider 普适复现。**
13 changes: 13 additions & 0 deletions docs/v4.1/DEEPSEEK_V4_TRAJECTORY_ANALYSIS_20260814.md
Original file line number Diff line number Diff line change
Expand Up @@ -140,3 +140,16 @@ minimal 对齐的策略区域。
只丢一个 context reason 语义字符串;两轮 ambient 泄漏都被堵住。这已经足以否定第一轮只是
偶然抽到高分样本的简单解释。现有证据不值得再为同一题追加付费运行;下一次应换结构不同
的工程任务复验,检验两阶段锚定是否能跨题泛化。

## 2026-08-15 第三方独立复现指纹

[@NineThoughts0521](https://github.com/NineThoughts0521) 在同一 frozen Project2 task 上追加了预注册的 DSH 三枪和一枪 OpenCode exploratory replacement。公开聚合如下;`let me` 保留绝对数量,所有 wording 只作轨迹指纹,不作能力指标或因果证据。

| Harness / preset | Ability | reasoning blocks | `we` | `let me` | `let's` | visible replies | tool calls |
|---|---:|---:|---:|---:|---:|---:|---:|
| DSH Anchored Standard | 96 | 191 | 324 | 31 | 167 | 1 | 244 |
| DSH Standard | 89 | 88 | 25 | 149 | 2 | 41 | 166 |
| DSH Minimal-Full | 85.5 | 47 | 67 | 14 | 16 | 8 | 83 |
| OpenCode replacement | 93 | 65 | 22 | 119 | 3 | 35 | 152 |

Anchored 的首请求仅含 `pwsh/read`,随后恢复完整目录;Minimal-Full 和 Standard 从首请求即暴露完整目录。该单批次的轨迹分离与分数方向 **consistent with** 首请求 schema anchoring 的解释,但不能把 `we`、`let me` 或可见回复数量解释为能力原因,也不能外推到其他任务或 provider。完整 machine-readable aggregate、成本和 evidence manifest 见 [`独立复现报告`](./DEEPSEEK_V4_PRO_INDEPENDENT_REPLICATION_20260815.md)。
Original file line number Diff line number Diff line change
Expand Up @@ -125,6 +125,12 @@
- 声称 `We need`、`Good` 或低阶段回复本身导致高分;
- 声称 98/99 会在其他仓库、任务长度或 provider 上稳定复现。

## 2026-08-15 第三方 full-task 消融更新

[@NineThoughts0521](https://github.com/NineThoughts0521) 对同一 frozen Project2 task 做了三枪 DSH 独立复现:Anchored Standard `96`、Standard `89`、Minimal-Full `85.5`。Minimal-Full 从首请求暴露完整 Standard 25 项工具,Anchored 仍先暴露 `pwsh/read`,首次 durable tool call 后恢复完整目录;其 system 和首请求非工具字段通过 hash gate 对齐。该结果 **supports** 首请求 schema anchoring 在本题上有额外贡献,并与原有 Anchored 优于 Standard 的方向 **consistent with**,但每条件只有一枪,且 transition 时序仍属于 treatment,不能据此声称唯一变量或跨任务普适效果。

这批运行的轨迹统计只用于行为指纹,OpenCode replacement 只作另行登记的 exploratory harness comparison。公开汇总、schema gate、成本和限制见 [`独立复现报告`](./DEEPSEEK_V4_PRO_INDEPENDENT_REPLICATION_20260815.md) 与 [`实验目录`](../../experiments/deepseek-v4-pro-anchoring/RESULTS.md);DeepSWE 和 Terminal-Bench 本阶段未运行。

## 发布与证据边界

原始 JSON/session 含完整 reasoning、system prompt、工具结果、绝对路径和可能的环境信息,
Expand Down
1 change: 1 addition & 0 deletions docs/v4.1/README.md
Original file line number Diff line number Diff line change
Expand Up @@ -31,6 +31,7 @@
| [`DEEPSEEK_V4_PRO_HARNESS_ANALYSIS_20260814.md`](./DEEPSEEK_V4_PRO_HARNESS_ANALYSIS_20260814.md) | V4 Pro 灰测、正式版与 DSH 三 preset 对照 |
| [`DEEPSEEK_V4_TRAJECTORY_ANALYSIS_20260814.md`](./DEEPSEEK_V4_TRAJECTORY_ANALYSIS_20260814.md) | 思维链风格、PTC 调用结构与统计方法 |
| [`DEEPSEEK_V4_TRIGGER_MECHANISM_EXPERIMENTS_20260814.md`](./DEEPSEEK_V4_TRIGGER_MECHANISM_EXPERIMENTS_20260814.md) | Pro / Flash system 与工具目录触发消融、两阶段验证 |
| [`DEEPSEEK_V4_PRO_INDEPENDENT_REPLICATION_20260815.md`](./DEEPSEEK_V4_PRO_INDEPENDENT_REPLICATION_20260815.md) | [@NineThoughts0521](https://github.com/NineThoughts0521) 的独立 3+1 复现、Minimal-Full full-task 消融与证据边界;不并入维护者 formal `n` |

## 与 V4.0 / V5 边界

Expand Down
1 change: 1 addition & 0 deletions evaluator/reports/README.md
Original file line number Diff line number Diff line change
Expand Up @@ -16,6 +16,7 @@
| [`../../docs/v4.1/ROUND_SUMMARY_20260719.md`](../../docs/v4.1/ROUND_SUMMARY_20260719.md) | 轮次事实终稿 |
| [`../../docs/v4.1/DEEPSEEK_V4_PRO_HARNESS_ANALYSIS_20260814.md`](../../docs/v4.1/DEEPSEEK_V4_PRO_HARNESS_ANALYSIS_20260814.md) | V4 Pro 正式版 harness 与 preset 对照 |
| [`../../docs/v4.1/DEEPSEEK_V4_TRAJECTORY_ANALYSIS_20260814.md`](../../docs/v4.1/DEEPSEEK_V4_TRAJECTORY_ANALYSIS_20260814.md) | 轨迹风格、PTC 与可复算聚合统计 |
| [`../../docs/v4.1/DEEPSEEK_V4_PRO_INDEPENDENT_REPLICATION_20260815.md`](../../docs/v4.1/DEEPSEEK_V4_PRO_INDEPENDENT_REPLICATION_20260815.md) | 第三方独立 3+1 复现与 Minimal-Full full-task 消融;明确排除在维护者 formal `n` 之外 |

## V4.1a(历史过渡锚点,不重算)

Expand Down
Loading