项目使用“最便宜的致命实验优先”原则:先检查 oracle contact 是否能帮助当前重建,再检查 VLM evidence 是否在固定候选边上超过 geometry-only,最后才生成大规模 utility labels 和训练完整选择器。
Gate-A 主实验已完成 150/150 cells。其结果不能概括为简单的“通过”或“方向失败”:
- A1 contact headroom 通过:O2 相对 O0 的 GT-edge distance 为 -93.23 mm,95% CI [-113.30, -74.50];
- A2 unconditional safety 失败:penetration max 为 +13.24 mm,95% CI [7.41, 19.53],penetration mean 为 +3.55 mm,95% CI [1.53, 5.62];
- 因此原始
gate_a_pass=false保持不变,不允许事后放宽 margin; - 按冻结阈值导出的 O1 utility 标签为 21 helpful / 6 neutral / 23 harmful,证明存在非平凡 outcome heterogeneity,但尚未证明这些标签可由预优化特征预测。
立即执行顺序修改为:
- R0:同步代码/结果、建立版本控制、取得 CHI3D 原图;
- R1 / Gate-A2:在未使用开发事件上测试 contact weight 与一个 safety-aware optimizer;
- R2:PromptHMR → Multi-HMR → BEV/BUDDI/ProsePose 统一 baseline;
- R3 / Gate V0:三 VLM 冻结选型;
- R4 / Gate B:fixed-candidate geometry vs geometry+VLM residual;
- R5 / Gate C:matched-coverage use/abstain;
- R6 / Gate D:跨 subject/dataset/VLM/optimizer。
详细退出条件见 06_current_status_and_revised_route.md。下方六个月表保留为完整论文的长期工作包,不再代表当前一周的直接执行顺序。
| 周期 | 阶段 | 核心任务 | 退出产物 | Gate |
|---|---|---|---|---|
| W1–W2 | 文献与资源审计 | 接触/VLM 语料更新;关键 repo/license/checkpoint/data access;冻结数据和 metrics | literature matrix、baseline audit、data manifest | Gate 1 |
| W1–W3 | VLM sensor audit | 三个开放 VLM 统一 schema;20-event prompt debug;80-event locked utility audit | VLM audit、缓存、选型报告 | Gate V0 |
| W3–W4 | Baseline smoke test | 跑通 initializer、geometry-only、BUDDI/ProsePose;统一 renderer/metrics | 4 个 baseline 运行日志、固定 split | Gate 3 的前半 |
| W5–W6 | Oracle headroom pilot | 50–100 events;无 contact vs GT/oracle contact;重复优化估计方差 | oracle report、非劣界草案 | Gate A / Gate 4a |
| W7–W8 | Semantic residual pilot | fixed candidate bank;geometry vs +VLM;反事实边 | AUPRC/AURC/HarmRate pilot | Gate B / Gate 4b |
| W9–W12 | Utility benchmark v1 | 自动生成 paired outcomes;三类标签;泄漏检查;cluster split | benchmark schema、label QC、dataset card | Gate 4c |
| W13–W16 | 完整 selector | simple models→MLP;top-1→small set;calibration | 主模型、消融、matched-coverage 表 | Gate 4d |
| W17–W20 | 泛化/鲁棒/效率 | Hi4D 或第二 context;困难子集;noise;API/GPU 成本 | 泛化表、鲁棒表、failure registry | Gate 5 前半 |
| W21–W24 | 论文与复现 | 主图、主表、supp、代码清理、三种子/CI、内部反驳审查 | submission package | Gate 5 |
如果每周有效研究时间低于 20 小时,W17–W20 的范围必须减少为“一种 cross-context + 三个关键困难子集”,否则六个月窗口不现实。
- 领域分类包含 HMR、interaction/contact、VLM semantics、decision/risk 四个分支;
- 至少 20 篇高相关工作且核心近邻不少于 8 篇;
- 最近 3–6 个月 arXiv 和 CVPR 2026 已检查;
- 标准数据集、指标和公开代码已定位;
- 每个 gap 有至少两个分支的证据支持。
条件通过。 还需要逐仓库确认 commit、checkpoint、license 和数据访问,完成后才正式关闭 Gate 1。
Qwen/Qwen3-VL-8B-Instruct:MVP 主候选;OpenGVLab/InternVL3_5-8B-HF:同规模跨模型;openbmb/MiniCPM-V-4.6:1.3B 效率基线;- 固定日期闭源 snapshot:只在预算允许时作 upper bound。
- 三个开放模型均固定 revision、license、环境、图像预处理和解码参数;
- 统一
contact_sensor_v1JSON schema 跑通,invalid/retry 被完整记录; - 20 个 debug events 仅用于 prompt/schema,不进入模型优劣结论;
- 80 个 locked events 以 event/subject-pair 分组,不与最终测试集重叠;
- 生成能力与 fixed-candidate verifier/utility 能力分表评价;
- 主模型按 geometry→geometry+VLM 的 utility 增量、matched-coverage HarmRate 和 one-standard-error rule 选择;
- raw logits/entropy 在每个模型内校准,禁止跨模型直接比较。
未通过。 官方模型版本与 Apache-2.0 状态已核验,本地速度、显存、JSON 有效率和下游 utility 均未实测。
TrustContact 不是预测 contact 是否“看起来正确”,而是用同初始化配对优化的实际 outcome 监督一条 contact constraint 是否应被用于指定 SMPL-X pipeline,并在固定候选边下测量语义相对几何的增量。
- 与 ProsePose、APU、VLM Feedback、InterMesh、VLM-Guided GPA 的差异表完成;
- 75×75 region coupling 从贡献中删除;
- 贡献不超过三条;
- utility 的 context dependency 进入数学定义;
- 决定性实验、证伪条件和负结果路径均已冻结。
部分完成但未通过。 文献与最近工作差异已经可以写清,Gate-A 建立了 “收益与伤害并存”的问题证据,Gate-A2 进一步在审计过的 safer optimizer 上通过 aggregate safety;仍缺 PromptHMR 等统一 baseline 和 Gate-B semantic residual。只有这些完成后,方法创新才能从机制假设升级为可投稿主张。
- 一个标准多人 initializer:BEV 或 Multi-HMR;
- 一个 interaction baseline:BUDDI 或 geometry-only optimization;
- 一个最近 VLM baseline:ProsePose;
- 一个 non-language contact baseline:ISP 或可复现替代;
- 统一 renderer、body model、camera convention、contact ontology 和 metrics;
- 本地结果与官方趋势合理,差异有书面原因。
- 官方 repo 不可运行:保留完整错误记录、环境、issue 和替代实现;
- checkpoint 不可得:只在 related work 引用,不进入直接结果表;
- SMPL-X license 不允许再发布:代码只提供路径配置和下载说明;
- 闭源 VLM baseline:优先使用作者缓存输出,同时增加 open-VLM 路径。
未通过。 Multi-HMR 只有单图 engineering smoke;BUDDI 只有模块/CUDA 路径验证;ProsePose 的处理数据和 contact loss 已用于 Gate-A,但完整论文 baseline 尚未复现;BEV 仅有缓存初始化;PromptHMR 尚未安装。不得把这些状态写成“baseline 已跑完”。
问题: 在相同初始化和优化预算下,GT/oracle contact 是否改善 interaction geometry,而 pose/penetration 非劣?
Go: 事件级 paired estimate 显示主交互目标具有稳定改善,且预注册安全项未越过非劣界。
No-Go: oracle 也无改善或经常造成伤害。此时停止 selector,优先修接触 loss、权重或 initializer;若仍失败,终止方向。
2026-08-25 判定: 原始 Gate-A 未通过。主 contact 指标有稳定 headroom,但 penetration safety 系统性失败。项目进入 Gate-A2,而不是更改原 Gate-A 阈值。Gate-A2 首先排除“selector 只是在补偿一个过弱 optimizer”的替代解释;现有 O1/O2 标签只允许用于现象与数据设计诊断,不允许直接作为主方法成功证据。
2026-08-25 Gate-A2 判定: weight-only 的 0.10 在独立 confirmation 上仍因
penetration max/mean 失败;随后审计发布代码中的 hhcgen,在 development
冻结 hhcgen=0.03,并在未查看的 18-event reserve 上得到 GT-edge
-80.86 mm、95% CI [-118.67, -47.46],全部原安全上界通过。因此 Gate-A2
在 cached-BEV/CHI3D-s02 context 中通过,但原 Gate-A 失败不变,也尚不支持
任何 VLM/selector claim。
问题: fixed candidates 下,geometry+VLM 是否超过 geometry-only?
Go: 至少在 utility discrimination 与 matched-coverage downstream risk 中形成一致、统计稳定的增量,并在预先指定困难子集具有机制一致的表现。
No-Go: 语义增量为零或只在泄漏式随机 split 出现。转为 benchmark/negative-result,或终止“VLM selector”主张。
问题: 风险降低是否只是 coverage 接近零?
Go: 在非零且相对 baseline 可比的 coverage 下,HarmRate 下降且保留部分 oracle gain。
No-Go: 只有几乎全拒绝才能安全。此时方法没有部署意义,需重新定义决策成本。
问题: 是否至少跨一个 subject/domain/initializer 维持方向?
Go: ranking 或 matched-coverage risk 至少一项跨 context 保持,或少量 target calibration 可恢复。
No-Go: 完全崩溃。论文只能定位为 optimizer-specific diagnostic。
- CHI3D 中 50–100 个独立 interaction events;
- 以 event 和 subject-pair 分组;
- 每个 event 首轮只取一个视角,另一个视角作 consistency check;
- 不把同一 event 的多个 edge 当完全独立样本。
- 一个冻结 initializer;
- 一个冻结 VLM 或 ProsePose cached outputs;
- 75-region ontology;
- logistic regression 与两层 MLP 两个 selector;
- top-1 edge use/abstain。
- VLM 原始 edge;
- geometry-nearest edge;
- GT positive;
- chirality/person-swap/body-region substitution/no-contact 反事实负例;
- union 后去重,所有 selector 共用。
- identity packet:raw full、细轮廓 marked full、joint-person crop;
- 单人 crop 只作肢体定位,不作接触存在性验证;
- proposer 受控采样 5 次、top-K=3;
- verifier 使用 fixed candidate bank 和 forced choice;
- 3 个冻结 paraphrases、1 次 flip、1 次 person swap;
- 所有图像/prompt/model revision/seed/output/token score 以 hash 缓存。
- no refinement;
- geometry-only refinement;
- always use VLM edge;
- raw confidence;
- sampling agreement;
- geometry-only selector;
- geometry+VLM selector;
- oracle edge。
- relative-root/global pair error;
- contact precision/recall 或 PCC;
- penetration 与 per-person pose non-inferiority;
- HarmRate;
- utility AUPRC;
- risk–coverage/AURC。
- CHI3D event/subject grouped split;
- 同 candidate、initializer、optimizer 和 VLM budget;
- 与 no-contact、BUDDI/geometry、ISP、ProsePose、APU-style、simple selectors 和 oracle 比较;
- 主结论:在可比 coverage 下是否减少 harmful refinement 并保留 contact gain。
- 主:CHI3D;
- 辅助:FlickrCI3D,用于 candidate/contact prediction;
- 外部 3D:Hi4D;
- Stretch:Harmony4D/MAMMA/Inter-X++ 的受控子集。
- 高互遮挡;
- 左右手性混淆;
- 人物身份交换;
- 极端视角;
- 小人物/低分辨率;
- 深度歧义;
- 接触区域面积小;
- 无接触或近而不触;
- 训练外交互类别。
- geometry only / semantics only / combined;
- raw confidence / sampling / paraphrase / flip / person swap;
- no gradient features / cosine only / cosine+norm;
- binary vs three-class utility;
- top-1 vs top-2 greedy marginal;
- temperature/isotonic/beta calibration;
- logistic/MLP/树模型;
- 25%/50%/100% utility labels;
- 一个开源 VLM 与一个闭源/cached VLM;
- initializer 或 contact-weight change。
- raw full / marked full / joint crop / contact-site crop;
- proposer-only / proposer+balanced verifier;
- sampling N=1/3/5/10;candidate K=1/3/5;
- self-reported confidence / option margin / calibrated evidence;
- marker color swap 与无颜色标签;
- Qwen/InternVL/MiniCPM 的 raw、standardized、target-recalibrated transfer。
- Candidate generator × selector 二因素表;
- 语义信息在固定 edge identity 后的增量;
- 每类 VLM inconsistency 与 harmful outcome 的关联;
- outcome label 是否只是 gradient cosine 的复制;
- selector 收益是否来自参数量、更多数据或更低 coverage;
- edge utility 与 set utility 的偏差。
- unseen subject pair;
- unseen camera/view;
- cross-dataset;
- cross-initializer 或 cross-loss;
- unseen interaction category;
- source-only 与少量 target recalibration。
- 图像 blur/noise/downsampling;
- mask/box/keypoint perturbation;
- initial mesh translation/pose perturbation;
- hallucinated edge、chirality swap、person swap;
- prompt paraphrase;
- VLM missing/empty output;
- optimizer budget 和 contact weight sensitivity。
- VLM queries 和 token/API 成本;
- paired label generation 的 GPU 时间;
- selector 参数量、训练时间、单边推理时间;
- 每图 optimization 时间和显存;
- 缓存前后总成本;
- 相比 ProsePose/APU 的额外成本。
- safe coverage–query cost Pareto;
- always-five-samples 与 uncertainty-triggered adaptive querying;
- 各图像 packet 的视觉 token、峰值显存和 latency 分解。
- 10%、25%、50%、100% utility labels;
- event/subject stratification 不变;
- 每个比例至少三 seed 或 bootstrap CI。
- GT contact existence;
- GT region pair;
- oracle best edge;
- oracle best weight;
- oracle best small subset;
- 用于定位 candidate、selector、weight 和 optimizer 的瓶颈。
- 学习型 selector 原则上使用 3 个 seeds;
- optimization 若确定性不足,pilot 重复运行以测量标签方差;
- 主置信区间以 interaction event 或 sequence 为 cluster bootstrap 单位;
- 同一 event 的 view、frame 和 edge 不独立计数;
- 报告 paired effect 与 95% CI;
- 主终点和非劣界在测试前冻结;
- 不以 PA-MPJPE 单独代表双人相对位置;
- conformal guarantee 只在满足相应 exchangeability 假设的域内陈述;
- cross-domain 只报告经验风险,除非另有 shift-aware 理论和实验。
- interaction recognition failure;
- body-part grounding failure;
- left-right confusion;
- person identity swap;
- depth ambiguity;
- occlusion/visibility failure;
- semantically correct but optimizer-harmful;
- semantically wrong but geometrically harmless;
- contact set conflict;
- mesh penetration;
- initializer already optimal/no headroom;
- out-of-distribution interaction;
- calibration/domain-shift failure。
每个失败类型记录发生频率、数据条件、候选生成器、选择器输出、最终 outcome、主要责任模块和可修复性。
| 论文主张 | 必须有的证据 | 若证据失败 |
|---|---|---|
| VLM confidence 不等于 constraint utility | confidence–outcome calibration、分组分析、反例 | 降级为个别模型/数据观察 |
| Outcome supervision 改善安全选择 | fixed candidates、matched coverage、HarmRate/AURC | 删除方法主张 |
| VLM evidence 超过 geometry | geometry vs +VLM,完全控制 candidate | 转为负结果 benchmark |
| 方法具备一定泛化 | cross-subject + 一个 cross-context | 限定为 pipeline-specific |
| 风险可控 | 独立 calibration split、假设说明、域内实证/理论 | 只写 empirical selection,不写 guarantee |
- 1 × RTX 5090 32GB 用于冻结 HMR、SMPL-X optimization、轻量 selector 和 1.3B/8B open VLM;Qwen 8B 官方权重文件约 17.5GB,但多图激活/KV/服务开销仍须本地实测,不能预先保证批量配置;
- 不计划训练大 VLM 或从头训练大 diffusion HMR;
- 如果某 baseline 原训练需要多卡,只运行官方 checkpoint 或缩小为推理比较。
建议初始预算:
- 代码/环境:10–20GB;
- SMPL-X/HMR/VLM weights:35–70GB(三个开放 VLM BF16/量化版本不应全部重复缓存);
- CHI3D/FlickrCI3D 和预处理:30–60GB;
- VLM output、image packet、token score、mesh、metrics cache:15–35GB;
- 保留至少 30GB 安全空间。
Hi4D/Harmony4D 完整视频可能超出剩余空间,应按 sequence 下载、处理后归档,或只保留抽帧/SMPL-X/annotation。禁止缓存全顶点 all-pairs distance tensors。
- 每个实验必须先注册 ID、claim、config、seed 和预期解释;
- 每张论文表能追溯到 checkpoint、config、log 和 commit;
- failed runs 不删除,写入 registry;
- 新论文出现后记录是否改变 novelty、baseline 或 protocol;
- 数据 split 一旦用于主结果不得事后重切;
- 测试集只用于冻结后的最终运行;
- 不依据最终结果改变 HarmRate margin 或主终点;
- 所有 VLM output 默认缓存,保证成本和可复现性。
项目已具备可以执行的边界、证据地图、RQs、baseline 分层和 kill gates, 并完成 Gate-A/Gate-A2。下一阶段仍不是大规模训练 TrustContact,而是关闭 原始图像/data manifest 与顶会 baseline gate。
- 将最终 Gate-A2 配置、代码、analysis/evaluation/logs 同步并记录快照;
- 取得 CHI3D 原始图像并建立不改变既有 cohort 的 image manifest;
- 安装 PromptHMR,运行 interaction-off/on official-checkpoint smoke;
- 将 Multi-HMR 接入相同共享关节和相机评测;
- baseline 前置通过后,再运行 Qwen/InternVL/MiniCPM Gate V0;
- 只有 fixed-candidate Gate B 证明语义 residual 后,才生成大规模 utility dataset 和训练完整 selector。