- 当前阶段:Stage 0–2,项目边界、文献地图、gap/RQ 冻结;
- 完成内容:
- 审查原 Novelty Audit;
- 核验 ProsePose、APU、ISP、BUDDI、PromptHMR、VLM Feedback、InterMesh、SocialMirror、VLM-Guided GPA、Inter-X++ 等最近邻;
- 将首篇论文收缩为 conditional utility + selective abstention;
- 删除 75×75 coupling 新颖性主张;
- 建立 baseline 分层、MVP 和四个 kill gates;
- 新发现:
- “Adapting Human Mesh Recovery with Vision-Language Feedback” 是原审查遗漏的语言→HMR refinement 近邻;
- InterMesh 使“interaction semantics improves HMR”的宽泛主张失效;
- ISP 已覆盖 75×75 双边 contact signature;
- CHI3D 视角/事件相关性要求 cluster split;
- 当前假设:H1/H2/H3 见
02_gap_rq_baselines.md; - 当前风险:两个 MAJOR——新颖性稀释和范围过大;
- Novelty 影响:从“VLM×contact 新方法”调整为“decision-focused constraint utility benchmark 与 policy”;
- 新增 baseline:Adapting HMR with VLM Feedback、InterMesh、ISP、Decision-Focused Learning lineage;
- 下一步:关键 repo/data/license audit 和 baseline smoke test;
- Gate:Gate 1 条件通过,Gate 2/3/4 未通过。
- 当前阶段:Gate V0 设计、最新 novelty watch 与实验注册;
- 完成内容:
- 核验 Qwen3-VL-8B-Instruct、InternVL3.5-8B-HF、MiniCPM-V 4.6 的官方版本、Apache-2.0 许可与本地部署入口;
- 将 MiniCPM-V 效率基线明确为 1.3B 的 4.6,不再使用模糊“系列版本”;
- 审计 proposer、逐边 verifier、5 次采样、paraphrase、flip、person swap、crop 和 selector features;
- 识别并修复
penetration changeoutcome leakage; - 建立 20-event prompt debug + 80-event locked VLM utility audit;
- 新阅读/核验:InteractVLM、GECO、ContactPrompt、REACT、LayoutVLM、LRR-Bench、ViewDiag、Qwen3-VL、InternVL3.5、MiniCPM-V 4.6;
- 新发现:
- ContactPrompt 已覆盖多阶段结构化接触推理;
- REACT 已覆盖“距离候选 + VLM 多视图真假验证”,但任务是人形机器人接触 retargeting,且当前为匿名在投;
- ViewDiag 表明 consistency 可以高而 accuracy 很低,一致性不能直接作 use 规则;
- SocialMirror 已把 confidence、adaptive reweighting、semantic–visual agreement 写为未来方向;
- Novelty 影响:generate-then-verify 和结构化 JSON 降级为必要实现;核心继续收缩为 outcome-supervised utility、fixed-candidate residual value 和 no-harm selection;
- 当前风险:Gate 2 仍未通过;Qwen 的任务优势和 5090 实际配置尚无本地证据;
- 下一步:先做 oracle-headroom,再完成 Gate V0 三模型 locked audit;
- Gate:Gate V0 未通过,Gate 1 条件通过,Gate 2/3/4 未通过。
- 当前阶段:Gate-A oracle contact headroom;VLM/selector 训练尚未授权;
- 已完成内容:
- 在数据盘隔离创建
/root/autodl-tmp/vlmcontact,不修改既有 3D 瑜伽工程; - 固定 Multi-HMR、BUDDI、ProsePose、PyTorch3D 和 DINOv2 仓库版本;
- 建立 Python 3.10 / PyTorch 2.7.1+cu128 环境;
- 从源码构建 PyTorch3D 0.7.9,并在 RTX 5090 上通过 CUDA
knn_points; - BUDDI optimizer/loss/diffusion 核心模块导入通过;
- TrustContact 单元测试 6/6 通过;
- 审计 ProsePose CHI3D processed val:3656 records、914 events、429 eligible records、118 eligible events,包含 GT SMPL-X、75×75 contact、cached BEV SMPL-X;
- 在数据盘隔离创建
- 真实失败记录:Multi-HMR 上游 checkpoint URL、PyTorch 2.6+
weights_only、 DINOv2 网络获取、Anny 0.6 输出键均触发兼容问题,均保留独立 patch 与原始日志; - 当前硬阻塞:授权的
SMPLX_NEUTRAL.npz尚未放入项目资产目录; - 数据边界:processed CHI3D 可支持 Gate-A;raw CHI3D 仅在 VLM 图像推理和重跑 initializer 前必需;
- 下一步:完成 processed CHI3D 校验/manifest,跑通 Multi-HMR smoke,然后在 SMPL-X 文件到位后立即执行重复优化噪声试验与 paired O0/O1/O2;
- Gate:Gate 3 的基础代码/环境部分通过,Baseline 数值复现和 Gate-A 未通过。
- Multi-HMR Anny 单图前向与可视化成功,RTX 5090 记录约 421 ms;Anny 不是 Gate-A 的 SMPL-X baseline,因此不报告为任务性能;
- CHI3D 118 个 eligible events 完成 cached initializer 审计:
- GT 标注接触边的 full-region 最小距离均值 164.96 mm;
- 双人相对平移误差均值 180.85 mm;
- 正确 SMPL-X→OpenPose25 映射后的 VitPose 重投影误差均值 17.27 px;
- low-resolution winding-number 最大穿透深度均值 35.16 mm;
- 发现并修复:错误使用 SMPL-X 前 25 joints 会产生约 156 px 的伪重投影 误差;该映射错误已增加单元测试;
- 解释边界:以上只证明 initializer 与评测有明显改进空间,不证明 GT contact
约束在受控优化下有效,
scientific_result=false; - Gate 状态:环境和 metric plumbing 通过;Gate-A 仍等待 SMPL-X neutral 模型 后执行 O0/O1/O2 配对干预。
- 授权
SMPLX_NEUTRAL.npz已安装并通过 CUDA 前向与拓扑校验; - 发现官方
heuristic_02_chi3d.yaml的注释与实现不一致:配置选择hhcdistmin,而该 loss 完全忽略 75×75 contact map。早期三条件相同的结果 因此作废,不进入论文证据; - Gate-A 改用仓库中真实消费 contact map 的官方
hhcmap实现,并记录该 protocol deviation; - 单事件预注册权重网格完成。权重越大,接触距离越小,但重投影与 pose
安全代价增大;冻结
w=0.1进入 noise pilot; - 完整收敛记录 5:O0 实际 138/452 步,O2 实际 156/408 步;O2 将 GT-edge distance 78.11→41.84 mm、relative translation error 160.33→105.70 mm、 penetration max 71.50→65.58 mm、reprojection 6.206→6.121 px;MPJPE 与 PA-MPJPE 各约 +0.81 mm;
- 10 events × O0/O2 × 3 repeats 共 60 runs 已以固定配置启动;完成前不冻结 neutral band,也不启动 VLM;
- 单元测试:本地隔离插件并设置
PYTHONPATH=src后 8/8 通过; - Gate:Gate-A 有正向单事件证据但尚未通过,等待重复噪声和多事件结果。
- 完整性:10 events × O0/O2 × seeds 42/43/44 = 60/60,失败 0;
- 重复噪声:全部最终参数与指标在 cell 内一致,经验 range=0;因此主实验每 cell 只跑一次,并改用 event-level bootstrap 表达不确定性;
- O2−O0 GT-edge distance:mean −88.67 mm,median −74.90 mm,95% cluster bootstrap CI [−126.55, −50.59],10/10 events 改善;
- relative translation error:mean −91.01 mm,CI [−153.31, −31.66];
- 30 mm contact F1:mean +0.0527,但 CI [−0.0285, +0.1779],禁止声称稳定提升;
- 冻结非劣界限后,noise-pilot advancement check 全部通过;这只允许进入 main Gate-A,不是最终 Gate-A pass;
- 主 cohort:排除 10 个 noise events 后,从剩余事件按 8 类动作分层固定 50 events;O0/O1/O2 共 150 cells 已后台启动;
- 研究边界:released val 全部来自 s02,最终结果不能支持 subject generalization claim;
- Gate:Gate-A in progress;VLM/selector 仍未授权。
- Gate-A 主实验完整性:50 events × O0/O1/O2 = 150/150 cells,失败 0;
- 主要结果:O2−O0 GT-edge distance mean −93.23 mm,95% event bootstrap CI [−113.30, −74.50];relative translation error mean −58.10 mm,CI [−77.70, −39.45];MPJPE mean −0.81 mm;
- 安全失败:penetration max mean +13.24 mm,CI 上界 +19.53 mm;penetration
mean +3.55 mm,CI 上界 +5.62 mm,均超过预注册 margin;最终
gate_a_pass=false。这说明接触约束有明显收益也有真实伤害,支持 utility selector 的问题设定,但禁止在 utility/no-harm 标签重冻结前开始大规模训练; - 顶会 baseline 审计新增关键工作:REMIPS(NeurIPS 2021)、CRMH(CVPR 2020)、GroupRec(ICCV 2023)、SAT-HMR(CVPR 2025)、HUG3D(CVPR 2026 Highlight)、Frequency-Domain Denoising(CVPR 2026);
- 冻结单图主表:BEV、Multi-HMR、PromptHMR interaction off/on、BUDDI、 ProsePose、TrustContact;其中 PromptHMR 是最高优先级新增复现;
- 分轨决定:CloseInt/CloseApp/频域方法仅进入 video track;VLM-Guided GPA 与 HUG3D 作为机制/最新任务近邻,不在代码不可用或输出不匹配时伪造数值比较;
- 当前服务器仅有 processed CHI3D,原始 JPG/PNG 数量 0;新增 feed-forward baseline 的硬前置是取得原始 CHI3D 图像;
- 下一步:重冻结 composite utility 与 penetration-safe labels;下载/挂载 raw CHI3D;按 PromptHMR → Multi-HMR → SAT-HMR(效率可选)顺序复现。
- 当前阶段: Gate-A 完成后的问题验证与 safety-aware optimizer 前置。
- 完成内容:
- 从服务器同步
gate_a_main_50的 analysis、evaluation 和日志到本地; - 核对远程 SMPL-X neutral asset,SHA256 与 handoff 文档一致;
- 确认服务器无后台实验,RTX 5090 空闲,CHI3D 原图仍为 0;
- 审计所有研究文档、动态表、TrustContact 源码、配置、测试和关键脚本;
- 修正
utility.py与真实 Gate-A 冻结安全指标不一致的问题; - 新增
export_gate_a_utility_labels.py,按实验前冻结阈值导出事件级标签; - 本地单元测试 10/10 通过;
- 新增
configs/gate_a2_safety_repair.yaml和修订实验路线。
- 从服务器同步
- Gate-A 最终结果:
- 50 events,150/150 cells,0 failures;
- O2-O0 GT-edge distance -93.23 mm,95% CI [-113.30, -74.50];
- relative translation -58.10 mm,95% CI [-77.70, -39.45];
- penetration max +13.24 mm,95% CI [7.41, 19.53],超过 10 mm margin;
- penetration mean +3.55 mm,95% CI [1.53, 5.62],超过 3 mm margin;
- 原始
gate_a_pass=false保持不变。
- Utility 标签诊断:
- O1:21 helpful / 6 neutral / 23 harmful;
- O2:15 helpful / 5 neutral / 30 harmful;
- harmful 主要由 penetration 触发。
- 新发现: contact headroom 与 safety harm 同时成立,形成了真实的 selective-decision phenomenon;但如果不加入 safety-aware optimizer control,审稿人可以合理质疑 selector 只是在修补过弱 optimizer。
- 当前假设: 预优化 geometry+VLM evidence 可能预测 constraint utility;尚无实验证据。
- 是否影响 novelty: 强化 outcome-aware use/abstain 动机,不改变“75-region/contact-aware reconstruction 本身不新”的裁决。
- 是否新增 baseline: 主表保持 BEV、Multi-HMR、PromptHMR off/on、BUDDI、ProsePose;Gate-A2 新增 safer-optimizer control,不作为外部论文 baseline。
- 是否调整 Research Question: 主 RQ 不变,但增加前置条件:必须在至少一个经过审计的 safety-aware optimizer context 中测试。
- 下一步: 同步更新代码到服务器;冻结 Gate-A2 未使用事件;审计 penetration/collision loss;取得 CHI3D 原图;安装 PromptHMR。
- 当前阶段: Gate-A2 完成;原 Gate-A 失败判定保持不变。
- Cohort 完整性: 从 58 个未使用 eligible events 冻结 development 20、 confirmation 20、reserve 18;与 noise/main 不重叠;reserve 在最终配置冻结前 未运行或查看。
- Stage-0 development: O0 加 O1 contact weights 0.03/0.10/0.30, 80/80 cells、0 failures。0.03 与 0.10 通过全部检查;冻结规则选择 0.10。
- Stage-0 confirmation: 40/40 cells、0 failures。O1-O0 GT-edge distance
mean -41.58 mm,95% CI [-70.75, -20.09],19/20 events 改善;但 penetration
max CI 上界 12.79 mm > 10、mean 上界 4.23 mm > 3,故
confirmation_pass=false。该 cohort 未被重跑或用于后续权重选择。 - Safety-loss 审计: 选择发布代码中的 ProsePose
GeneralContactLoss(hhcgen)。record 1053、weight 0.10 的加权 loss 0.468、translation gradient norm 45.81;4-step paired smoke 中 O1 penetration max 64.50→58.12 mm、mean 18.71→16.60 mm,梯度与短程方向均通过。 - Stage-1 development: contact weight 固定 0.10,O0/O1 均加入相同 hhcgen,扫 0.03/0.10/0.30;120/120 cells、0 failures。三档全部 eligible; 0.03 的接触改善 -63.15 mm,与最优 0.10 的 -67.24 mm 相差 4.09 mm,按 预冻结 within-5-mm tie-break 选择更小的 0.03。
- Stage-1 reserve confirmation: frozen
hhcmap=0.10, hhcgen=0.03, 18 events × O0/O1 = 36/36 cells、0 failures。GT-edge distance mean -80.86 mm,95% CI [-118.67, -47.46],18/18 改善;relative translation -44.44 mm;penetration max/mean CI 上界 6.21/2.60,低于原始 10/3 margins; MPJPE、PA-MPJPE、PVE、reprojection 也全部通过,最终confirmation_pass=true。 - 事件级异质性: reserve 仍为 8 helpful / 2 neutral / 8 harmful;aggregate safety pass 不等于每个 contact edge 都安全,selective-utility 问题仍存在。
- 工程修复: evaluator 在
chdir前统一解析所有输入输出路径;runner 新增--penetration-weight、loss/gradient provenance;sweep analyzer 支持 contact 与 penetration 轴及 reserve cohort;本地测试 10/10,脚本编译与 bash syntax 通过。 - 中断恢复: reserve 运行期间远端 SSH/实例短暂中断;数据盘保留 13 个结果, 可恢复 runner 正确跳过已有 JSON 并补齐 36/36,未覆盖已有单元。
- 是否影响 novelty: 排除了“selector 只是在修补明显过弱、无 collision handling 的 optimizer”这一最直接替代解释;但尚未证明 VLM residual value。
- 是否新增 baseline: hhcgen 是优化器 control,不冒充外部论文 baseline;主表 仍为 BEV、Multi-HMR、PromptHMR off/on、BUDDI、ProsePose、TrustContact。
- 下一步: 取得 licensed raw CHI3D 并冻结 image manifest;安装和 smoke PromptHMR interaction off/on;随后才允许 Gate V0,不启动大规模 VLM/selector。
- 当前阶段: R0 数据闭合未完成;R2 baseline gate 部分完成。
- PromptHMR provenance: 官方仓库固定到
3b566b7dbb28ce506c7ea972c18693f4c705ce8c;checkpoint/config SHA-256 分别为a3ef04ef...e97e99与31142aaa...a2447;许可为仅限非商业科研,禁止再分发。 - 环境: 单独克隆兼容环境,固定 PyTorch 2.7.1+cu128、xFormers 0.0.31、
Ultralytics 8.3.80、PyTorch Lightning 2.4.0。官方 xFormers attention 在
RTX 5090
sm_120失败,运行时仅将无参数 attention operator 替换为 PyTorch SDPA;官方 tracked source 保持 clean,checkpoint 仍 strict load。 - off/on smoke: 官方
example_1.jpg、相同 top-2 boxes、无 mask;仅切换 cross-person attention。预热后 off/on 53.26/56.63 ms;on-off paired output displacement 为 vertices 41.13 mm、joints 42.21 mm、translation 43.01 mm。 结论仅为开关可执行且非退化,scientific_result=false。 - 评测审计: 官方入口检查
CHI3D_TEST,但 released Evaluator 没有对应 constructor branch;不能把当前 smoke 写成官方 CHI3D reproduction,需共享 evaluator adapter。 - raw manifest: 新增
CHI3D-RAW-IMAGE-FREEZE-V1,对既有 main-50 cohort 要求 exact canonical stem 唯一命中,并记录 path/dimensions/bytes/SHA-256; missing、ambiguous 或 invalid image 一律不落最终 manifest。本地/服务器均为 0/50 resolved、50 missing,符合当前 raw image 缺失事实。 - 验证: 本地与服务器测试均为 13/13;PromptHMR 环境
pip check通过; checkpoint 与支持资产完成跨机器 hash 校验。 - 当前风险: raw CHI3D 仍是硬阻塞;PromptHMR official interaction package 还包含 mask prompt,必须与只切换 cross-person attention 的主消融分开报告。
- 是否影响 novelty: 不改变 TrustContact utility gap;进一步确认 PromptHMR 已覆盖一般 cross-person interaction reasoning,因此不能主张“首次引入交互语义”。
- 是否新增 baseline: PromptHMR 从 queued 变为 engineering-runnable; Gate 3 仍未通过,直到 PromptHMR 与 Multi-HMR 跑同一冻结 CHI3D manifest。
- 下一步: 取得 licensed CHI3D 原图并严格冻结 50-event manifest;随后只跑 PromptHMR off/on 与 Multi-HMR 共享评测,继续禁止大规模 VLM/selector 训练。
- 服务器状态: 已重新连接;RTX 5090 空闲,无残留 PromptHMR、Multi-HMR、 VLM 或 selector 进程。
- 数据复核:
/root/autodl-tmp/vlmcontact/data/raw仍为空;服务器没有新增 CHI3D 压缩包或能匹配冻结 cohort 的原图。当前唯一 RGB 是 Multi-HMR 官方 Anny 示例软链接,禁止将其当作 CHI3D 结果。 - 新增执行门: 实现
CHI3D-BASELINE-INPUT-VERIFY-V1。在每个方法推理前 重算 manifest SHA-256,并逐图检查路径不能越出 raw root、文件存在、字节数、 SHA-256 与宽高;manifest id、行数、顺序或 event 唯一性异常也会 fail closed。 - 验证: 新增完整、图片篡改、manifest 篡改和缺失 manifest 四类测试;本地 全套测试 17/17 通过。服务器同步后必须再次运行同一测试和真实 preflight。
- 研究影响: 不新增模型贡献;它保证 PromptHMR/Multi-HMR 比较真正使用 byte-identical 输入,并堵住数据漂移或误用 processed pickle 的复现性风险。
- 当前 Gate: Gate 3 仍不通过;raw CHI3D 是唯一阻止 fresh unified inference 启动的直接数据阻塞。继续禁止大规模 VLM/selector 训练。
- 下一步: 原图就位后先冻结 50-event manifest,再通过输入完整性门,随后 依次运行 PromptHMR box-only off/on、PromptHMR official mask+interaction 和 Multi-HMR,并进入共享 evaluator。
- 冻结脚本补为真正 immutable:已有 manifest/lock 与新解析完全一致时幂等 返回,不改写;只要图片 bytes、source manifest、cohort 或 lock 有差异就拒绝 覆盖。新增两项回归测试后本地与服务器均为 19/19。
- 新增 PromptHMR main-50 runner:同图、同 top-2 detector boxes、无 mask,成对 运行 interaction off/on;模型只加载一次,保存 pose/betas/transl/vertices/ body_joints/cam_int、boxes、耗时与全部 hash provenance。
- 新增 Multi-HMR main-50 runner:使用 pinned Anny checkpoint 与官方默认 FOV/detection 路径,保存逐人全部 tensor、camera、原始尺寸与 provenance。
- 两个 runner 均先调用 byte-integrity gate;断点跳过只在 event、image hash 和 run-config hash 全部一致时发生,任何冲突都中止而不是覆盖。
- 新增统一 launcher 的
preflight/显式run两种模式。服务器实跑 preflight 在 freeze 阶段因 0/50 原图返回非零并停止,证明不会加载模型或制造结果。 - 当前 GPU 2 MiB / 32607 MiB、利用率 0%,无 baseline、VLM 或 selector 后台任务。
- 当前阶段: R2 的 Hi4D baseline gate 完成;小规模 Gate-V0 可以开始, 大规模 VLM 与 selector training 仍未授权。
- Hi4D 数据审计: train/test 为 75/25 个不重叠序列、600/200 个 sequence-camera clips、70,600/24,960 帧;八相机帧集合一致。images.zip 中 95,560 张图与 annotation 路径完全对应,masks.zip 中 191,120 张 mask 恰为 两人各一张。标注是 SMPL(72 pose、10 betas、6,890 vertices),不是 SMPL-X; contact 为 0 sentinel 或 1..6890 的一基 partner vertex id。
- 冻结输入:
HI4D-BASELINE-TEST100-V1固定 Camera04、25 个 test sequences、每序列四个均匀帧,共 100 张;manifest SHA-256 为32b7af96...cc5e4e。所有图像路径、bytes、dimensions 与 SHA-256 通过 独立 preflight,统计按 sequence cluster 而不是把四帧当独立样本。 - PromptHMR: GT-box off/on 100/100 成功;detector-native 97/100 成功, 三个漏检事件完整保留。checkpoint 仍用 strict loader,RTX 5090 的 xFormers attention 仅在运行时替换为无参数 PyTorch SDPA。
- Multi-HMR: 下载并核验 ECCV 2024
multiHMR_896_L.pt,SHA-256c1b55933...02ca;DINOv2 source archive SHA-256eebbfa9e...10497,强制 offline torch-hub load。100/100 inference 完成, 93 帧输出两人、7 帧输出一人;median forward 42.84 ms。Anny checkpoint 不再作为论文主 baseline。 - 共享 evaluator: 使用 Hi4D 内置 gender-aware SMPL-24 GT joints;预测 SMPL-X vertices 经 PromptHMR 发布的 24x10475 joint regressor 转换;individual metrics 用 SMPL hip midpoint,pair PA 对两人 48 joints 只做一次 similarity transform。Multi-HMR 用 padded-image center matching,Prompt detector track 用 detector-box-to-person-ID matching;missing person 只影响 coverage,不被 静默删除。10,000 次 sequence-cluster bootstrap。
- 端到端 detector track: Prompt off/on coverage 均 97%,root MPJPE 37.53/36.98 mm,PA-MPJPE 20.34/20.05,pair PA 50.28/49.96;Multi-HMR coverage 93%,对应 70.11/54.86/85.89 mm。数值是条件几何均值,必须和 coverage 一起报告。
- 关键机制结果(GT-box): on-off root MPJPE -0.378 mm,95% cluster CI [-0.709,-0.028];PA-MPJPE -0.193 [-0.326,-0.053];但 pair PA +1.140 [+0.115,+2.208]、relative pelvis +3.692 [+0.626,+6.796]。interaction-on 改善单人姿态却损害双人布局,独立支持“intervention utility 是 context/outcome dependent”的故事线;仍不证明 VLM 能预测这种效用。
- 协议限制: 当前是 TrustContact shared SMPL-24 protocol,不冒充 PromptHMR 官方 H36M-14/PVE 表。精确 PVE 仍受 Google Drive evaluation annotation 路由与 licensed gendered SMPL assets 阻塞。
- 代码验证: evaluator、person matching、pair metric 与 offline DINOv2 loader 已加入;本地测试 27/27 通过。
- 下一步: 冻结 75-region ontology 版本、Hi4D 20-image prompt-debug subset 和 disjoint locked Gate-V0 subset;只运行 Qwen3-VL-8B 的格式、A/B 身份、左右与候选接触 smoke,全部 JSON/hash 缓存。通过前不扩到三模型, 不训练 selector。
- 冻结数据与隔离: 从
HI4D-BASELINE-TEST100-V1按完整 sequence 划分 20 张 prompt-debug 图像和 80 张LOCKED80;两者 sequence/event 零重叠。 DEBUG20 manifest SHA-256 为9a929071...aa1b66,LOCKED80 为595eabbb...f1bf27。本轮没有对 LOCKED80 做推理或目视检查。 - ontology 纠偏: 冻结的 FlickrCI3D/CHI3D 75 区域是 SMPL-X 顶点 patch,
官方文件没有可直接交给 VLM 的自然语言部位名。因此另冻 31 个 RGB 可观察
语义区域,仅用于候选生成;从 31 区到 75 patch 的映射仍为
not_frozen, 当前 VLM 输出禁止直接成为 optimizer constraint。 - 模型与复现: 使用冻结的
Qwen/Qwen3-VL-8B-Instructrevision0c351dd...7ff3b,ModelScope 传输 revision1610d9f...8dc9;16/16 权重文件 通过 size/SHA-256 校验。VLM 全冻结,RTX 5090,本轮无训练。 - prompt 版本纪律: v1 负样本照抄 prompt 中具体示例边,判失败;v2 删除
示例后仍在明显无接触图上输出两个 confidence=1.0 的 contact,判失败;仅在
DEBUG20 的两张预检图上形成 v3。v3 增加同一图像位置触点检查、明确框重叠
不是证据、遮挡时允许
uncertain/空边。数据、模型和 Go/No-Go 阈值始终不变。 - v3 预检: 负样本返回空边;正样本返回一条
near_contact;格式、身份、 ontology 与边数均合规,故允许执行 DEBUG20,而不是宣布模型有效。 - DEBUG20 执行: 20 张 × 5 次,共 100/100 缓存完成;100% JSON 有效、 100% A/B identity 合规、0 次超过 top-3。累计推理 288.72 秒,median 2.62 秒/样本。所有 cache 含 model/prompt/image/generation hash 与 seed。
- provenance erratum: 产物回传后的 fail-closed 审计发现 v1-v3 协议内 DEBUG20/LOCKED80 manifest hash 各有一次 65 字符转录错误。原协议均保留; v3.1 首次修正 locked hash 后又被审计器拒绝,v3.2 才同时匹配两个 immutable CSV。v3.2 的 reference、manifest、prompt、model revision/config、identity packet、ontology、event/sample count 共 10 项 provenance checks 全部通过。 LOCKED80 从未运行,cached inference 与数值未受该元数据错误影响。
- 冻结 Gate 结果:
gate_pass=false。contact-only majority 的 TP/TN/FP/FN 为 0/8/1/11,balanced accuracy 0.444 < 0.60;粗边 TP/FP/FN 为 0/1/87, precision 0 < 0.50;没有 laterality-evaluable prediction,因此 laterality check 失败。JSON、identity、edge-cap、complete-events 四项通过。 - 失败后诊断(不改变 Gate): 100 次输出包含 112 条
near_contact、仅 5 条contact。若把contact|near_contact|uncertain只解释为 proposer candidate,事件存在性为 TP/TN/FP/FN=10/8/1/1,balanced accuracy 0.899; 但 exact coarse-edge precision 仍仅 0.10(2 TP、18 FP),recall 0.023。 这说明 Qwen 对“是否存在交互邻近区域”有信号,但具体 body-part grounding 不可靠;该数值是 post-gate diagnostic,不能覆写 Gate 失败结论。 - 代表性失败:
talk23/000039在无接触 GT 上 5/5 稳定输出 A.left_hand–B.left_hand contact,构成 consistent-yet-wrong 反例;另一方面 11 个接触事件没有任何一个被多数样本判为contact,显示 v3 由幻觉转为near_contactstate collapse。采样一致性不能被当作正确性或 utility。 - 当前结论: 以
gate_v0_protocol_v3_2.json和qwen_debug20_v3_2_audit.json为最终可追溯判定。Gate-V0 不满足进入 locked audit、跨 VLM 或 selector 训练的 条件。结果反而加强了 TrustContact 的核心动机:VLM 只能产生有噪声的语义 候选证据,不能直接决定约束;但在证明 verifier/geometry 能修复细粒度 grounding 前,不得声称 utility selector 已可行。 - 下一步: 保留 v3 与失败结果不改动;在 DEBUG20 内新增固定候选逐边 verifier 小实验,使用 GT-positive、几何 near-contact 和对抗负边的平衡 bank, 检验 verifier 是否把 coarse-edge precision 从 0.10 提升且不牺牲负样本 specificity。若 verifier 仍失败,则停止 Qwen 路线并重新评估候选 ontology/ visual grounding;LOCKED80、InternVL、MiniCPM 和 selector 继续冻结。
- Gate-V0b 文本 fixed-edge 预检: 冻结 49 条 coarse candidate bank;其中
proposer consensus 为 20 条、精度 0.10,另含 11 条正 anchor、11 条同事件
hard negative 和 9 条 no-contact control。只查询一真一假两条预检边。四次
查询中 JSON 有效率 0.75;support-first 对真/假边均回答
supported, falsification-first 对真/假边均给出contradicted语义,暴露严重 prompt polarity bias。完整 98-query run 未启动。 - 协议/实现纠错: Hi4D 的 orientation-free
torso_mid不再被任意映射为abdomen_front;改用 direction-agnostic coarse ontology。PromptHMR 源码确认body_joints是 OpenPose BODY-25,而不是 native SMPL-X 25。旧 overlay v1 将 index 21 左脚跟误当右手、index 16 左眼误当左肩,已保留为失败证据; V0c-v2 修正为 OpenPose 映射并加入源码/hash provenance。 - Gate-V0c 配对定位实验: 在相同模型、相同一真一假边、相同两份中性化
JSON prompt 和确定性解码下,对比 A/B boxes-only 与 PromptHMR joint-region
overlay,共 8 次查询。两臂结果完全相同:prompt A 对两边均
supported, prompt B 对两边均contradicted;JSON/identity/echo/provenance 均 1.0, 但 prompt agreement=0、polarity conflict=1.0。表明失败不是部位标记缺失, 而是模型服从 prompt 立场。49-edge run 继续冻结。 - Gate-V0d 中性证据分解: VLM 不再输出最终 decision,只报告 highlight
alignment 与
surface_meeting / visible_gap / depth_ambiguous / occluded;最终 三分类由预注册代码规则产生。另冻 basketball28 的 4 条 prompt-dev 边和 sequence-disjoint talk23 的 4 条 audit 边。dev 的 8/8 JSON 有效,但 4/4 consensus 全为uncertain,agreement=0.5、coverage=0,因此 audit 组从未 运行或查看。 - camera-specific visibility 诊断: 用 Hi4D GT pose/contact、Camera04 内参、GT person masks 和 joint two-person z-buffer 构建 20 帧 contact visibility artifact。neutral-SMPL 对标注 joints 的总体 mean reprojection error 为 11.59 px,最大 person-mean 25.32 px;visible silhouette IoU mean 0.710、min 0.340。87 条 coarse GT contact edge 均有至少 5% 双端可见 correspondence;V0d/V0e 四条正边双端可见比例为 1.00、0.93、0.78、0.81。 该产物是诊断 proxy,不是官方 Hi4D visibility annotation。
- Gate-V0e predicted-surface grounding: 利用冻结 PromptHMR interaction-off
SMPL-X vertices、官方 sparse SMPL-X→SMPL transfer、SMPL segmentation 与
two-person z-buffer,仅渲染当前候选的可见 mesh surface;不使用 GT contact
或 GT masks。相对 V0d 只改变视觉表示。dev 仍 4/4 abstain,agreement=0.5、
polarity conflict=0.25、coverage=0。尤其在候选 surface 为 0 visible pixels
时,两个 prompt 分别产生
surface_meeting与visible_gap,构成明确的 empty-pointer hallucination。 - 停止判定: V0b、V0c、V0d、V0e 均按各自预注册门槛失败;没有运行 talk23 audit、49-edge full、LOCKED80、InternVL、MiniCPM 或 selector training。 不再对已查看的 basketball28 dev 图修改颜色、措辞或阈值。当前证据不支持 Qwen3-VL 作为 contact verifier;它最多保留为高噪声候选/语义特征源。
- 路线更新: 下一步回到论文核心 Gate-B:用冻结的 candidate bank 做真实 optimizer intervention,建立 helpful/neutral/harmful outcome labels;首先比较 geometry-only 与 geometry+现有离线 VLM evidence。只有 VLM 在 event-grouped held-out utility 指标上提供增量,才恢复跨 VLM/selector 论证,否则删除 “VLM verifier”主张并将以上结果作为系统性失败分析。
- 协议状态: 新增
GATE-B-PILOT-V1。它复用已经完成的 Gate-A2 reserve18 真实 O0/O1 优化结果,因此是posthoc_development_only,不能作为 locked confirmation。候选边固定为 75-region GT map 中按字典序选择的 top-1;优化器 固定为 ProsePose HHCS、hhcmap=0.10、hhcgen=0.03、两阶段最多各 1000 次、 seed 42。 - 严格配对审计: 36 个 optimizer cells 形成 18/18 完整 pairs;O0 无边、
O1 恰好一条边;initializer、seed、iteration budget、contact/penetration weight
全部一致。冻结 candidate bank SHA-256 为
99bb5827c78f4027974612ab84925db9348f0c9589b25a1ec4669ffeae52a68d。 - 真实 utility 标签: 沿用 Gate-A noise pilot 前冻结的 outcome margins,得到 8 helpful / 2 neutral / 8 harmful。该分布说明安全优化器下仍有真实的 conditional utility,但不等于 selector 已经有效。
- 无泄漏几何特征: 只使用干预前 candidate contact loss/translation gradient、 penetration loss/gradient、initial reprojection 和 relative translation norm。 region ID、GT edge count/distance、所有 after/delta/label 均排除在 feature matrix 之外。
- 开发性预测: 按 7 个 interaction families leave-one-group-out。冻结 logistic regression 的 harmful AP=0.714、ROC-AUC=0.688、Brier=0.211、risk-coverage AUC=0.284;简单 contact-loss 风险分数对应 0.536/0.488/0.374/0.491。geometry 在 25% coverage 保留的 4 个事件中 HarmRate=0、helpful=3/4,但 n 很小。
- 不确定性: 10,000 次 interaction-family bootstrap 中,geometry 相对简单 contact-loss 的 AP 差 CI 跨 0(约 [-0.142, 0.495]),不能声称稳定胜出;相对 training-fold prevalence 的 AP 差 CI 为 [0.069, 0.697],但该对照受 group-size/ prevalence 排序影响,只能作管线控制。
- VLM 对齐审计: Gate-B labels 是 CHI3D 18 events;现有离线 Qwen evidence
是 Hi4D 4 events,精确 event overlap=0。已执行 fail-closed 判定
do_not_run_geometry_plus_vlm,禁止按动作名或跨数据集伪配对。因此当前 Gate-B semantic residual 为not_evaluable_unaligned_offline_evidence,不是 pass/fail。 - 复现: 本地全套测试 67/67,通过服务器归档 SHA 校验与 targeted 9/9; 服务器重算得到相同 event/label counts 与关键 point estimates。
- 下一步: 在 Hi4D DEBUG20/PromptHMR initializer 上实现一个 2-event、4-edge optimizer smoke,先验证 coarse→75 patch 映射、O0/O1 paired geometry 和评价 指标;只有 smoke 通过才扩到与 Qwen cache 一一对齐的 Hi4D Gate-B cohort。
- 映射冻结: 使用官方 sparse SMPL-X→SMPL transfer、SMPL coarse segmentation
与 75-region patch 定义,按正 transfer mass 构造 coarse→r75 映射;75 个 patch 中
64 个通过 purity≥0.60 与 mass≥1 门槛,本次四条候选涉及的 7 个 coarse regions
全部可映射。冻结 artifact SHA-256 为
7d602d2033ffaafaa9c9ad0b929b16ead782c141192dd82114608fb3c192ae8e。 - 工程 smoke: 固定 basketball28 的 2 个 prompt-development events、4 条 balanced fixed edges,运行 O0/O1 共 8 cells、每阶段 2 iterations。8/8 完成; 初始化逐事件一致,O0 零边、O1 恰一边,O1 contact translation gradient 全非零, 重复 O0 输出逐事件完全一致,因此授权仅对同四条候选运行冻结 full optimizer。
- 完整干预: PromptHMR box-only interaction-off 初始化;由初始化 mesh/camera
生成共同 pseudo-2D anchor;ProsePose HHCS 固定
hhcmap=0.10、hhcgen=0.03、 seed 42、两阶段各最多 1000 次。8/8 cells 完成,使用 Hi4D 真实 contact correspondence 与真实 SMPL 参数只作干预后的 outcome evaluation。 - 真实 outcome: 四条候选产生 1 helpful / 2 neutral / 1 harmful。真
torso_mid→torso_mid使 GT-contact distance 降 20.04 mm 且无 safety violation; 真right_shoulder→right_forearm只改善 0.41 mm,判 neutral;假left_shoulder→right_forearm使 GT-contact distance 增 47.34 mm、pair-PA 增 19.95 mm、relative pelvis error 增 96.42 mm,判 harmful。这直接证明 semantic truth 与 downstream utility 不能互换。 - VLM 精确对齐: V0d predicted-overlay 与 V0e surface-overlay 的 candidate、
event、raw image hash 和 coarse edge 均与上述四条 outcome 一致。两套 Qwen
fixed-rule 对四条候选全部为
uncertain,coverage=0;所有 JSON、A/B identity 与 candidate echo 检查通过。prompt disagreement 恰覆盖唯一 harmful,但也误报 一个 neutral,且两个 flagged candidates 来自同一 event,属于 event-confounded development diagnostic,不能声称 VLM residual。 - Gate 判定:
gate_b_semantic_residual_pass=false;状态为not_evaluable_n4_two_events_zero_fixed_rule_coverage。没有训练 selector,也没有 解封 talk23 audit、LOCKED80 或跨 VLM。Gate-B 的 outcome-generation mechanism 已通过小规模验证,但论文的 VLM 增量主张仍未通过。 - 下一步: 先在已使用的 DEBUG20 development partition 冻结一个更大的、 event-balanced candidate cohort,生成同图同边 outcomes,并以 event-grouped geometry-only 为先验控制;只有预注册样本量、标签多样性与 useful coverage 达标后,才测试 geometry+缓存 VLM evidence,随后才允许一次 locked confirmation。
- 冻结 cohort: 从已有 Qwen DEBUG20 五次缓存中保留频率至少 1/5 的全部
eligible coarse edges,共 35 candidates、13 events;32 条非 GT coarse edge、
3 条 GT coarse edge。候选 bank SHA-256 为
a8114996528b6f0d84d029fb7cdcf3b288ef1848e5fdc398c6324501aa9f5edf。 - 运行矩阵: O0 在同一 event 内与 candidate 无关,因此冻结为 13 个
event-level O0 加 35 个 O1,共 48 full optimizer cells;所有 O1 使用相同
PromptHMR GT-box interaction-off initializer、r75 nearest subedge、HHCS
hhcmap=0.10、hhcgen=0.03、seed 42、1000×2 iterations。 - 特征与评价: 在查看标签前冻结 7 个 geometry features 与 10 个 cached-VLM features;禁止 region ID、GT semantic label、after/delta/outcome leakage。 geometry-only、VLM-only、geometry+VLM 使用同一标准化 logistic,按 event 做 leave-one-group-out,并冻结 AP、risk-coverage、Brier 与 50% coverage Go 条件。
- 自动收尾: batch 完成且无 failures 后才运行 Hi4D GT outcome evaluator, 随后运行 selector evaluator;任一步失败均 fail closed。没有新增 VLM inference, 没有解封 LOCKED80。
- 创新纪律: 新增
07_innovation_gates.md。创新一尚未开始;只有 Gate-B 形成可解释结果且完成新的 closest-work novelty audit 后才提示开始创新一了!!!!。创新二只允许由创新一 MVP/消融揭示的第二个独立瓶颈 触发,并在第二次 novelty audit 通过后提示开始创新二了!!!!。
- 运行完成: Gate-B DEBUG20 的 13 个 event-level O0 与 35 个 O1 全部完成, 48/48 cells、0 failure;得到 28 harmful、5 helpful、2 neutral。
- 注册结论: geometry-only 的 AP/AUC/Brier/risk-AUC 为
0.846/0.566/0.226/0.717;geometry+VLM 为
0.790/0.444/0.274/0.777。50% coverage HarmRate 从 0.765 升到 0.824,
四项 Go check 全部失败,
development_go_for_future_locked_test=false。 - 不确定性: combined-minus-geometry 的 group bootstrap AP、AUC、Brier、 risk-AUC 差值 95% CI 均跨零;方向总体更差,但不能声称 VLM 必然有害。
- 候选偏置: 35 条中 3 条 GT-positive、32 条 GT-negative;三条真边均未 harmful。四条假边被全局 contact/geometry proxy 标 helpful,需要 candidate-local outcome 区分 instrumental utility 与 proxy exploitation。
- target 分解: 28 harmful 中 16 safety-only、11 contact+safety、1 contact-only; 当前 label 主要反映 optimizer compatibility,而非接触语义。
- 有效样本: 35 candidates 只来自 13 events、5 sequences;最大 sequence 占 42.9%,22/35 候选位于 label-pure event。原 event-grouped OOF 仍可能共享 sequence context,后续必须按 sequence/subject-pair 分组。
- 特征审计: geometry 7 维 rank=6,VLM 10 维 rank=7;frequency 与 A/B visibility 完全共线,uncertain rate 恒定。VLM frequency 在仅 9 个 within-event comparable pairs 上有 post-hoc 方向信号,但不允许据此改规则。
- 新 novelty audit: ProsePose/APU/InteractVLM/VLM-GPA/MAMMA/RHINO/ CrossHOI/REACT 已覆盖 contact generation、过滤、多视图、uncertainty 或 mesh critique;generic DFL/selective/trajectory prediction 也已有先例。未检索到与 human-human per-edge paired vector outcome、reversible response probe、 sequence-disjoint risk evaluation 四项同时重合的工作。
- 路线重构: 创新一进入
Contact Intervention Outcome Factorization研究阶段: VLM 只负责 semantic admissibility,短 counterfactual optimizer probe 负责 benefit/safety response,最后 use/abstain。立即只允许 Gate-BR0 target repair 和 BR1 probe smoke;LOCKED80、跨 VLM 和大规模 selector 继续冻结。 - 复现: 新增
scripts/audit_gate_b_failure_attribution.py和 4 个单元测试, 本地 4/4 通过;artifact 为audit/gate_b/hi4d_debug20_failure_attribution_v1.json。
- 局部指标修复: 旧 evaluator 合法复用 event-level O0 参数,但对复用候选沿用了 第一条 edge 的 distance。BR0 从保存的 13 O0 与 35 O1 SMPL-X 参数重建 mesh,针对 每条 selected R75 edge 重新计算 full-resolution minimum 与 ProsePose-sampled bidirectional nearest-neighbour mean/RMS。
- 复现验证: 35 O1 与 13 direct-O0 共 48 个 saved-distance 对照的最大绝对误差 0.0238 mm,低于冻结 0.1 mm 容差;35/35 vector outcomes 全 finite;本地与服务器 targeted tests 均 7/7 pass。
- 四条争议边: GBD20-0004/0005/0006/0010 的局部 full-min 分别从 383.29→332.85、251.43→127.75、361.88→206.03、376.50→194.16 mm;虽然全局 GT-contact 改善 198.75–244.55 mm 且 safety pass,但 5/10/20/50 mm 下均没有形成 false contact。判定为本 cohort 中的 safe instrumental constraints,而不是 induced-false-contact 或已证实的 proxy exploitation。
- 真边饱和: 两条 true/neutral edge 在 O0 已约 3 mm,O1 几乎不变;一条 true/helpful edge 从 74.92 降至 40.10 mm。semantic truth 因而既不能预测 safety, 也不能保证仍有非零 marginal utility。
- 新风险: 32 条 false edges 中没有一条在 O1 后进入 50 mm;当前 natural bank 无 induced-false-contact 正例。BR1 必须预先加入 O0-nearest hard-negative stratum, 不能通过事后修改阈值制造类别多样性。
- Gate:
br0_pass_for_br1=true,只授权 BR1 protocol freeze 与 K-step probe smoke。LOCKED80、新 VLM 和高容量 selector 保持冻结。 - 产物:
audit/gate_br0/hi4d_debug20_vector_outcomes_v1.json、audit/gate_br0/hi4d_debug20_disagreement_v1.csv、research/09_gate_br0_vector_outcome_audit.md。
- 独立 cohort: 从 Hi4D train 冻结 12 个 sequence、12 个 subject pair、12 类
interaction;与 DEBUG20/LOCKED80 sequence 均无重叠。manifest SHA-256 为
f00b8599c69d837df8647c5b9dddd44e508577d7fde62693775d64f1552a7c8f。 - 初始化与候选: PromptHMR GT-box interaction-off 12/12 成功;在 outcome 前冻结 12 个 GT-positive、12 个 O0-nearest hard-negative、12 个 distance-matched semantic-negative,共 36 candidates。
- 响应矩阵: 每个 K={1,5,20,100,1000} 独立从同一 initializer 重启,包含 12 event-level O0 与 36 candidate O1,共 48 cells。正式 K=1 已 48/48、0 failure; K=5 已启动。
- 预注册判据: 在 K=1000 evaluation 前新增
configs/gate_br1_decision_policy_v1.yaml,冻结 candidate-local/global-contact Spearman、安全违规召回、false-contact crossing 召回与 runtime fraction 门槛。 - 自动收尾: 已启动独立 postprocessor;矩阵完成后逐档生成 GT outcome 与 candidate-local vector,最后执行 sequence-cluster bootstrap 和 Go/No-Go。 新 VLM、selector、LOCKED80 与创新二仍未授权。
- 测试: 新增三套 evaluator/finalizer tests;本地与服务器均 16/16 通过。
- 完成性: K={1,5,20,100,1000} 共 240/240 optimizer cells、0 failure;五档 outcome/vector evaluation 和最终 probe-response analysis 全部完成。
- 冻结判定:
pause_and_diagnose,没有 K 获准进入 BR2。K=1/5/20 的 local/global rank correlation 均低;K=100 的 local/global Spearman 达 0.831/0.745,O1 runtime fraction 为 0.242,三项均通过。 - 决定性失败: K=100 safety violation recall 为 4/7=0.571,低于冻结 0.80; 漏检 football18 一条 late penetration-mean 和 game22 两条 late penetration-max violation。收益可预测不等于风险可预测。
- 不确定性: K=100 local/global sequence-cluster bootstrap CI 分别为 [0.518,0.977] 与 [0.296,0.945]。24 个 semantic-negative 在 K=1000 下没有 5–50 mm 新 false-contact crossing,因此该风险轴仍无正例。
- 数值修复: postprocessor 首次因默认 CUDA cdist 与稳定 cdist 的近零数值差异 fail closed;没有放宽 0.1 mm 门槛,而是分离 runner-compatible 参数复现与稳定科学 指标。修复后五档复现最大误差均为 0,相关 tests 15/15 通过。
- 下一步: 只执行 BR1-Safety 轨迹归因,检验 late safety 是否可由 slope、 curvature、gradient conflict 或 conservative bound 提前识别;不启动 selector、 新 VLM、LOCKED80 或创新二。
- 冻结诊断: 对 K={1,5,20,100} safety deltas 按既有 margin 归一化,预先冻结 last-segment log bound、all-point log-linear、quadratic diagnostic 与 conservative envelope;target 仍是已有 K1000 any-safety violation。
- 固定规则结果: last-segment 检出 6/7、late 2/3,但 8 FP、precision 0.429;
envelope 同为 6/7、late 2/3,但 11 FP、precision 0.353。没有规则满足全部门槛,
判
require_intermediate_checkpoint_pilot。 - 梯度冲突: 从 K20/K100 保存参数重算 contact–penetration gradient cosine; K100 translation 与 pose+translation negative-cosine 描述性 AUC 均 0.918,但仅 27/36 finite,且只覆盖 5/7 positives,不作为 gate rule。
- 透明更正: V1 的 2/3 浮点门槛多写约 3.3e-11;V1.1 correction-only 修复后 overall No-Go 不变,因为 eligible rules 仍失败 precision。
- K250: 已冻结并启动 48-cell K250 pilot;不调 threshold、不训练 selector。 自动后处理将按 recall≥0.80、late recall≥2/3、precision≥0.50、runtime≤0.50 给出下一判定。
- V1 反证: 预注册 absolute post-step penetration filter 在 BR1-10-2、11-0、 11-2 上均为 harmful。机制大量拒绝 optimizer step,冻结基础图像拟合,却仍没有 保证相对 O0 的完整 safety vector;按冻结 gate 拒绝,未调阈值。
- V2 反证: same-step base-vs-full counterfactual filter 仅将 BR1-11-0 降为 neutral;BR1-10-2 与 11-2 仍 harmful,并产生约 2--4.5 倍运行成本。说明 hhcgen + non-contact objective 不是完整 downstream safety 的充分代理;按冻结 gate 拒绝。
- 实现审计修复: 旧 gradient extractor 错误包含
global_orient且遗漏 stage-0betas。V2 extractor 依据官方 optimizer 的实际 active parameter groups 重算; K100 translation/stage1 negative-cos AUC 为 0.918/0.909。 - 开发假设: 固定
stage1 contact/penetration gradients both active and cosine >= 0规则接受 12/36,组成 10 helpful、1 neutral、1 harmful,accepted full-safety violations 为 0。BR1-10-2 的 penetration gradient inactive,因而 inactive 明确定义为 abstain。 - 独立 cohort: 冻结 Hi4D Camera04 的 15 个新 sequence、3 个未见 subject
pair 和 45 candidates;与 DEBUG20、LOCKED80、BR1 sequence 均不重叠。manifest
SHA-256 为
0c9238091e6c0cc1ad0ec310bb2e13eabbc250bc58d51ca7ae9c058a944d11355。 - 执行: PromptHMR GT-box initializer 15/15 完成;candidate bank 45/45 冻结; pipeline/evaluator tests 本地与服务器 5/5 通过。后台已启动 K100 probe + K1000 reference 的可恢复确认管线。
- 纪律: 确认集不调零阈值;stratum/GT/VLM truth/outcome label 均禁止进入 policy; LOCKED80、新 VLM、selector 和 Innovation Two 继续冻结。通过只代表 Innovation One MVP,之后仍需 PCGrad 与 geometry-only matched-coverage baselines。
- 独立确认失败: K100/K1000 矩阵与 45/45 gradient artifact 全部完成,0 runtime failure;固定 gradient rule 接受 5/45,coverage 0.111,harm rate 0.20,1 个 accepted safety violation,helpful retention 2/13。除 harm improvement 与 compute 外,其余核心 Gate 均失败;没有调 cosine threshold,也没有运行 conditional PCGrad/baseline expansion。
- Factorized selector 失败: 双头 response V1 的 1369 组阈值没有可行解。随后对 response、gradient、off-target clearance 和组合四个预定义 feature families 做 leave-one-sequence-out 审计,harm OOF AUC 为 0.409--0.482,四组仍无可行策略; 扩大特征不能解释为创新。
- V2 失败确认: same-step hhcgen/base-objective counterfactual filter 只保护 BR1-11-0,BR1-10-2 与 BR1-11-2 仍违反冻结 safety vector,拒绝。
- V3 targeted: candidate-conditioned 30 mm off-target envelope 按冻结配置运行
3/3 known failures,0 optimizer failure,总耗时 820.91 s。BR1-10-2 安全且保留
13.126 mm local gain;BR1-11-0 安全且保留 0.037 mm gain;BR1-11-2 仍有
penetration-max violation,故总 Gate 为
reject_v3_stop_method_expansion。 - 失败定位: BR1-11-2 最大 86.502 mm penetration 位于 B 的 R75 {3,17,72} 对 A 的 R75 {61},均不是候选 A49→B8 目标 patch。根因是每区域 10 顶点的稀疏 envelope 漏掉 off-target collision witness,而不是目标接触豁免。
- 停止纪律: 不把 samples-per-region 从 10 调到 40,不改 margin/容差,不运行 V4,不触碰 former confirmation 或 LOCKED80。Innovation One 当前标记为未完成; 下一轮若继续,必须先对覆盖完整、MaxIntersection-compatible collision certificate 做新的 novelty audit 和独立预注册。Innovation Two 仍未启动。
- R4 smoke: TwinGuard full-mesh bidirectional penetration certificate 在 BR1-11-2 的 2+2 smoke 上通过,保存 2-stage trace;unit suite 同步覆盖 one-sided penetration、certificate 与 evaluator congruence。
- 冻结效率停止: 第一条正式 targeted candidate BR1-10-2 的 R4 runtime 341.535 s,对应完整 O0+O1 paired baseline 192.746 s,fraction 1.77195 > 1.25。 立即停止剩余 targeted matrix,未调频率、阈值或 candidate-specific 规则。
- 工程审计: exact AABB pruning 在两份 saved states 上与 full winding mask 完全 一致,但 speedup 0.6296/0.9302,不能挽救效率;R4 正式拒绝。
- 问题重构: 使用 DEBUG20 natural35、BR1 balanced36、历史 independent confirmation45 构建 CIU-BENCH-PILOT-V1,共 116 candidates、40 events、32 个 sequence-disjoint sequences。train15 仅保留为已拒绝 gradient rule 的历史确认, 不得作为未来方法的新 test。
- QC: candidate IDs 唯一;三 cohort sequence overlap 为 0;116/116 primary continuous gains finite;116/116 有完整七维 safety;2 条无 GT-contact 的记录使用 explicit missingness;严格 JSON 禁止 NaN。构建测试 3/3 通过。
- 主要数字: Always-use harmful/safety 47.4%/44.8%;semantic GT filter 仍为 30.0%/26.7%,只保留 32.5% helpful。balanced81 的 K100→K1000 local-gain Spearman 0.907 [0.801,0.970],但 K100 observable policy 的 full-safety violation 仍为 9/38=23.7%。Outcome oracle 在 34.5% coverage 下 harm/safety 为 0 并保留 全部 helpful,证明问题有非平凡上限但当前方法未达到。
- 创新状态: 原 gradient/TwinGuard 正向方法主张均拒绝;Innovation One 以 Contact Intervention Utility 问题定义、paired vector protocol、pilot corpus 与 failure-driven findings 完成 Minimum Viable Research。Full Conference Version 仍缺跨数据集/initializer/optimizer、published adapters、新 untouched method test 和 data card。
- 冻结纪律: LOCKED80、新 VLM、高容量 selector 与 Innovation Two 仍未启动。
- Exposure 审计: 完整 Hi4D 为 100 sequences / 20 subject pairs。32 sequences 已有 paired outcome,52 已有 image/initializer exposure;48 在审计时仍完全未暴露, 但历史完全未见 subject pair 为 0。新的 Hi4D subject-pair-disjoint TEST 因而按 fail-closed protocol 被阻止。
- Smoke 冻结: 从完全未暴露 train pool 冻结 20 个 contact-positive midpoint events,覆盖 12 pairs / 12 interactions,与全部历史 manifests sequence overlap=0; 科学角色永久为 construction-only。
- Initializer: PromptHMR off/on 20/20 双人;Multi-HMR 896L 推理 20/20,但 双人 coverage 16/20,四个 close-interaction case 仅输出一人。
- Qwen proposer: 冻结 revision 与 V3 prompt 下完成 20×5=100 次采样,JSON valid 100/100。20 个 natural proposals 全部映射到 R75;事后 GT-positive 5/20, alias 1,selection 未读取 outcome。
- Candidate bank: GT-positive、nearest hard-negative、distance-matched negative、 natural VLM proposal 各 20,共 80。
- K20 pipeline: 20 event-level O0 + 80 O1 共 100 cells,0 failure,923.817 s; evaluator 对 80/80 输出完整七维 safety。K20 诊断为 18 helpful / 34 neutral / 28 harmful,但明确禁止当 full outcome 或性能结论。
- Gate 判定: closure 16/16 checks 通过,决定为
pass_construction_smoke_proceed_to_corpus_design。 - 下一步: 启动 Gate-CIU-F1,冻结 known-subject in-domain split 与外部 unseen-subject OOD 需求;此前继续封存 LOCKED80,不跑 full K1000、不训练 selector, Innovation Two 仍未启动。
- Exposure ledger: Hi4D 100/100 sequences 已逐条登记 outcome、image/initializer 和 construction-smoke exposure,所有 sequence 恰好分配一次、split overlap=0。
- 主划分: DEV 32 sequences / 32 events / 128 planned candidates;VAL-ID 14/14/56;F1 时完全未暴露的 TEST-ID 28/84/336。Smoke20 永久排除。
- Action-OOD: 从 outcome-unexposed 但 image-exposed pool 保留 6 sequences / 4 DEV 未见 interactions(cheers、handshake、piggy、sidehug),形成 24-candidate diagnostic;因只有 6 clusters,不能代替外部 unseen-subject test。
- 规模: evaluation 总计 80 sequences、136 events、544 planned interventions; 每 event 冻结四个 strata。20 个 events 已预先指定为 Multi-HMR cross-initializer subset;cross-optimizer adapter 仍 blocked。
- 图像完整性: 第一次执行因仅 35/100 sequence folders 已解压而 fail closed。
随后从官方 32 GB
images.zip直接读取 canonical members;136 张中 1 张已解压、 135 张 archive-only,全部冻结 bytes/dimensions/SHA-256,未改变任何 split。 - Power: TEST-ID 在 coverage 25% 时预计 84 accepted。乘 1.5 design effect 后, 对 HarmRate 26.3%→5% 的强改善所需 68,近似通过;对 26.3%→15% 所需 302, 不通过。最终必须 sequence-cluster bootstrap,不能把中等差异的阴性结果写成无效。
- Gate: 17/17 checks 通过,决定为
pass_f1_authorize_dev_candidate_freeze_only。LOCKED80 恰好分解为 VAL-ID14 与 ACTION-OOD6,原 manifest 未修改且继续 sealed。 - 下一步: Gate-CIU-F2-DEV 只冻结 32 DEV events 的 128 条候选边和 feature schema,随后 bounded DEV preflight。VAL/TEST candidate construction、full K1000、 selector、LOCKED80 新推理和 Innovation Two 均未授权。
- DEV materialization: 32/32 canonical images 与 annotation boxes 完整;27 行来自
Hi4D train annotation、5 行来自 test annotation,但科学角色全部为 CIU-DEV。
初版错误单 annotation 索引在
basketball28/000072fail closed,未产生冻结输出; 修复后按 manifestdataset_split读取并分别记录 annotation SHA。 - PromptHMR: GT-box interaction-off/on 32/32 成功,0 failure。
- Qwen: frozen Qwen3-VL 32×5=160 samples,JSON 160/160 valid。28 个 events 产生 natural proposal;4 个 events 五次均为空集合,作为显式 abstention 保留, 没有用几何边补齐。
- Candidate bank: 32 GT-positive + 32 nearest hard-negative + 32 matched-negative
- 28 natural proposals = 124 executable edges;另有 4 abstention decision slots, 总 decision slots 仍为 128。协议修订发生在 optimizer outcome 前。
- Feature freeze: 124/124 records,10 个 candidate-time features,0 forbidden fields、0 outcome fields、0 VAL/TEST statistics;完整三阶段 schema 已冻结。
- K100 preflight:
argue10与hug14共 2 O0 + 8 O1 = 10 cells,0 failure, 238.656 s,七维 safety 完整;工程诊断为 2 helpful / 5 neutral / 1 harmful。 - Gate: closure 15/15 checks 通过,决定为
pass_f2_dev_authorize_dev_full_outcome_construction。下一步只允许 32 O0 + 124 O1 的 DEV K1000 corpus;selector、VAL/TEST、LOCKED80 和 Innovation Two 继续冻结。
- F3 corpus: 32 CIU-DEV events、124 executable candidates、32 O0 + 124 O1 共 156 个 K1000 cells 全部完成,0 failure;124/124 paired outcomes 和七维 safety 完整。标签为 43 helpful / 30 neutral / 51 harmful。
- Qwen 现象: 28 条 natural Qwen proposals 中 20 harmful、3 helpful、5 neutral; 无选择地使用时 HarmRate=71.4%,说明语义候选不能直接充当优化约束。
- 核心 selector: 在全部124条 outcome上训练轻量 harmful-risk logistic head,按 event 做5-fold grouped OOF;只在28条 frozen Qwen proposal上评估部署策略。25% coverage 接受7条,其中1 harmful / 2 helpful / 4 neutral,HarmRate=14.3%,保留 2/3 helpful,ordinal net utility 从 -0.607 转为 +0.036。
- 不支持的机制: Geometry与VLM early concatenation 在全部候选的25%/50%
coverage下均比 Geometry-only 更差,不能写成正向创新;当前支持的是“VLM proposer
- geometry outcome-risk filter”。
- 统计边界: sequence-cluster bootstrap 相对 matched random 的 HarmRate 差异均值 -0.467,95% CI[-0.857,0],lower probability=0.969;DEV信号有希望但样本仅28、 accepted仅7,不能当 held-out performance。
- 工程: 生成完整 JSON、OOF prediction CSV、主表、proposal filter 表、PNG/PDF Coverage–Safety 曲线;全项目测试 200/200 通过。
- 下一步: 冻结 geometry-risk 模型、特征和25% operating point,构造小规模 untouched sequence-disjoint held-out confirmation。Innovation Two K100 Probe 尚未启动。
- 范围与隔离: 使用 F1 预先冻结的 CIU-VAL-ID 14 个 sequence;没有访问 TEST-ID、ACTION-OOD,也没有启动 K100/Innovation Two。VAL 只运行一次 outcomes。
- 输入冻结: PromptHMR 14/14 成功;Qwen3-VL 14×5=70 samples,JSON 70/70 valid。得到 11 条可执行 natural proposals 与 3 次显式 abstention。
- 预 outcome selector: 仅使用 124 条 DEV outcomes 训练 geometry harmful-risk
logistic head,输入固定为 initial distance、box IoU、person scale ratio。VAL outcome
前冻结 11 个 risk scores 和按
floor(11×0.25)=2得到的接受列表;0 forbidden fields。 - 完整优化: 11 event-level O0 + 11 O1 共 22 个 K1000 cells,0 failure;累计 cell runtime 2246.8 s。前 8 个顺序执行,剩余 14 个仅改变 wall-clock 调度、以 3 workers 并行;optimizer、seed、loss、iterations 和冻结 plan 均未改变。
- 真实分布: 11 proposals 为 4 helpful / 1 neutral / 6 harmful。Always-use HarmRate=54.5%、safety violation=54.5%、ordinal net utility=-0.182。
- 冻结 operating point: 接受 2 条(1 helpful / 1 neutral / 0 harmful),
HarmRate=0、safety violation=0、helpful precision=50%、net utility=+0.091;但只保留
1/4 helpful,helpful retention=25%,低于冻结的40%门槛。因此严格决定必须保留为
fail_small_heldout_confirmation,不能宣称成功 selector。 - 统计与归因: 相对 matched random 的 HarmRate bootstrap 差异均值 -0.477, 95% CI[-1,0],lower probability=0.730,样本太小。只读 post-hoc 显示 harmful-risk AUC=0.933;排名前3为 neutral/helpful/helpful,HarmRate仍为0、retention=50%。这说明 ranking 有迁移信号,但 11 proposals 下 floor-25% 的离散化和 coverage–retention 权衡使冻结门槛失败;该诊断不能覆盖原 Gate。
- 当前判断: Innovation One 的“VLM proposer + outcome-risk filter”保留为有前景但 尚未验证成功的方法;CIU evaluation 与“直接使用VLM接触有害”的问题证据更稳。 在任何 TEST 运行前,需要重新冻结一个最小可部署策略(例如明确的最小接受数或 risk threshold),但不能回头把本次 VAL 改写为通过。