Skip to content

Latest commit

 

History

History
102 lines (73 loc) · 6.36 KB

File metadata and controls

102 lines (73 loc) · 6.36 KB

TrustContact 顶会级研究项目:第一阶段总览

当前结论: 项目值得推进,但首篇论文必须从“VLM + SMPL-X + contact”收缩为“VLM contact constraint 的 conditional downstream utility、selective abstention 与 no-harm evaluation”。当前只允许推进到 baseline/resource audit 和 MVP,不允许直接大规模训练。

1. 项目边界

  • 单张 RGB 图像,两名近距离交互人物;
  • 输出两个 camera-space SMPL-X、接触边效用和 use/abstain 后的精化结果;
  • 冻结 HMR 与 VLM,只训练轻量选择器;
  • 首篇不做视频主线、端到端大模型、75×75 新表示或稠密顶点对应;
  • 4–6 个月,1 × RTX 5090 32GB,约 158GB 可用存储;
  • 推荐准备 ICCV 2027,backup 为 CVPR 2028/下一届 3DV;3DV/ICRA/ICASSP 2027 当前截止时间过近。

详细定义见 项目宪章。

2. 文献检索策略

五个检索视角:通用多人 HMR、close-interaction/contact、language/VLM、decision/risk、批判性失败与 2026 最新工作;当前语料覆盖 40 个工作/项目,核心近邻包括 ISP、BUDDI、ProsePose、APU、GECO、InteractVLM、ContactPrompt、SocialMirror、InterMesh、VLM-Guided GPA、REACT novelty watch 和 Inter-X++。

详细策略和论文矩阵见 文献地图。VLM 型号、接触操作和最新 novelty threat 的专项审计见 VLM 语义接触传感器调研。

3. 领域分类

  1. 通用多人、whole-body 和 camera-centric HMR;
  2. interaction-aware、proxemics、physics 和 contact reconstruction;
  3. region/facet/vertex contact 数据与表示;
  4. language/VLM 作为 contact generator、semantic prompt、refinement guidance 或 mesh critic;
  5. decision-focused learning、selective prediction 和 conformal risk control。

当前真正空缺的 taxonomy cell 是:双人 SMPL-X 中,使用 paired optimizer outcomes 监督逐 contact constraint 的 use/abstain,并系统评价 harm 和跨管线上下文边界。

4. 候选 research gaps

已评分 10 个 gaps。最终选择:

  • G1:conditional downstream contact utility 与 selective abstention;
  • G2:fixed candidates 下 VLM evidence 超过 geometry-only 的 residual value;
  • G3:utility selector 跨 initializer/loss/domain 的迁移边界。

镜像/人物交换变成特征和 stress test;set-level marginal utility 进入 Full/Stretch;75×75 coupling 从贡献删除。

完整评分见 Gap/RQ 文档。

5. 候选 Research Questions

  • RQ1: outcome-supervised selector 能否在 matched coverage 下比 raw confidence、sampling agreement 和 geometry-only 降低 HarmRate?
  • RQ2: 固定候选 edge identity 后,VLM sampling/paraphrase/flip/person-swap consistency 是否仍提供几何之外的增量?
  • RQ3: source pipeline 学到的 ranking/calibration 能否迁移,还是必须针对 initializer/loss/domain 重新标定?

每个 RQ 均已定义独立变量、因变量、控制变量、机制、证伪条件和负结果价值。

6. Baseline 初步列表

  • 初始化器:BEV、Multi-HMR;Multi-HMR 2/PromptHMR 在资源审计后加入;
  • interaction/contact:no refinement、geometry-only、ISP、BUDDI;
  • VLM 最近邻:ProsePose、APU-style、raw confidence、sampling agreement;
  • simple selector:random/always/logistic/isotonic/gradient-only;
  • upper bound:GT contact、oracle best edge/weight/small subset;
  • 相邻强工作:CloseInt/CloseApp、InterMesh、SocialMirror、VLM-Guided GPA,根据输入和代码可用性进入补充比较。

VLM 传感器候选已经冻结为:Qwen3-VL-8B-Instruct(MVP 起点)、InternVL3.5-8B-HF(同规模跨模型)、MiniCPM-V 4.6 1.3B(效率基线)和固定 snapshot 的闭源 upper bound。最终主 VLM 由 20-event prompt debug + 80-event locked utility audit 决定,不由通用 VQA 榜单决定。

必须实际复现至少:一个 initializer、BUDDI/geometry、ProsePose、ISP 或 APU-style。

7. 完整项目路线图

  • W1–W2:repo/data/license audit;
  • W1–W3:Gate V0 VLM 统一 schema、三模型 smoke test 与 100-event 选型;
  • W3–W4:baseline smoke test 和统一 metrics;
  • W5–W6:50–100 event oracle-headroom pilot;
  • W7–W8:fixed-candidate semantic residual pilot;
  • W9–W12:utility benchmark v1;
  • W13–W16:selector、calibration 和小集合;
  • W17–W20:泛化、鲁棒、效率、失败分析;
  • W21–W24:统计复核、论文和可复现材料。

完整 gate、实验矩阵和资源计划见 项目路线图。

当前 Gate 状态

  • Gate 1 文献充分性:通过但持续更新;顶会 baseline 审计已加入 PromptHMR、CVPR 2026 机制近邻和分轨规则;
  • Gate-A1 contact headroom:通过;50-event O2-O0 GT-edge distance -93.23 mm,95% CI [-113.30, -74.50];
  • Gate-A2 unconditional safety:失败;penetration max/mean 未通过冻结 margin,原 gate_a_pass=false 不修改;
  • Gate-A2 safety-aware optimizer:通过;冻结 hhcmap=0.10, hhcgen=0.03 在未触碰 reserve 18 上通过 aggregate safety margins;
  • Gate V0 VLM 可审计性与选型:未通过;原始图像缺失,尚无真实 VLM 推理;
  • Gate 2 创新性:概念差异已冻结、实证未通过;等待 PromptHMR 对比和 fixed-candidate semantic-residual pilot;
  • Gate 3 baseline 可运行:未通过但前进一步;Multi-HMR 与 PromptHMR interaction off/on 均已通过 engineering smoke,仍缺同一 CHI3D 原图 manifest 上的统一数值评测;
  • Gate 4 核心假设:只建立问题现象;O1 为 21 helpful / 6 neutral / 23 harmful,但 selector 尚未训练;
  • Gate 5 论文完整性:未开始。

下一阶段唯一正确动作

Gate-A2 与 PromptHMR off/on engineering smoke 已完成。现在唯一允许的主线是: 取得 CHI3D 原始图像,让 fail-closed 校验器唯一解析并冻结现有 main-50 image manifest;随后在相同图像字节上运行 PromptHMR off/on 与 Multi-HMR 统一评测。完成后才运行 Qwen3-VL-8B-Instruct、InternVL3.5-8B-HF、 MiniCPM-V 4.6 的统一接触 schema,并以 fixed-candidate geometry→geometry+VLM utility 增量决定是否进入 selector。完整修订路线见 当前状态与修订实验路线。