Skip to content

Latest commit

 

History

History
202 lines (148 loc) · 9.33 KB

File metadata and controls

202 lines (148 loc) · 9.33 KB

TrustContact 项目边界与成功标准

冻结日期: 2026-08-24
版本: v0.1,文献与 MVP 设计阶段

1. 研究领域

项目位于以下交叉方向:

  • multi-person whole-body human mesh recovery;
  • close human-human interaction reconstruction;
  • SMPL-X contact modelling;
  • vision-language priors for 3D human understanding;
  • decision-focused learning、selective prediction 与 risk control。

项目的论文类型首先是 Novel Problem / Evaluation Protocol,其次才是轻量方法。它不是“把 VLM 接到 SMPL-X 后面”的组合型论文。

2. 一句话研究问题

在严重遮挡和深度歧义的双人交互图像中,能否依据一条 VLM 接触约束对指定 SMPL-X 重建管线的条件下游效用来决定使用或拒绝,并在固定候选边后证明 VLM 证据相对纯几何证据具有可测的增量价值?

3. 具体任务

给定一张含两名近距离交互人物的 RGB 图像,首先由冻结的 HMR 初始化器恢复两个人的 SMPL-X;随后由多个候选生成器产生身体区域接触边;选择器只利用优化前可得的几何、可见性和 VLM 一致性证据,预测每条边在指定优化管线中的 helpful / neutral / harmful 状态,并执行 use/abstain;最后用被接受的边精化相对位置、姿态与接触几何。

4. 输入与输出

输入

  • 单张 RGB 图像;
  • 两个人的检测框或分割结果;
  • 冻结 HMR 初始化器产生的两个 SMPL-X;
  • 候选接触边集合;
  • 可选的相机内参。若不可用,由初始化器估计或使用统一估计协议。

输出

  • 两个人的 SMPL-X 参数与相机坐标位置;
  • 每条候选边的条件效用分数或三分类概率;
  • use/abstain 决策;
  • 精化后的双人网格;
  • 可审计的拒绝原因特征,例如低采样一致性、镜像冲突或几何不兼容。

5. 建议 pipeline

flowchart LR
    A["RGB image"] --> B["Frozen two-person SMPL-X initializer"]
    A --> C1["VLM candidate edges"]
    A --> C2["ISP or visual-contact candidates"]
    B --> C3["Geometric-neighbour candidates"]
    C1 --> D["Fixed candidate bank"]
    C2 --> D
    C3 --> D
    B --> E["Pre-optimization geometry and gradients"]
    A --> F["VLM sampling, paraphrase, flip and person-swap consistency"]
    D --> G["Conditional utility selector"]
    E --> G
    F --> G
    G --> H{"Use or abstain"}
    H -->|use top-1 or bounded set| I["Contact-aware SMPL-X refinement"]
    H -->|abstain| J["Return base reconstruction"]
    B --> K["Paired optimizer interventions during label generation"]
    D --> K
    K --> L["Helpful, neutral, harmful labels and continuous deltas"]
    L --> G
Loading

6. 使用场景

  • 两人瑜伽、舞蹈、拥抱、搀扶、格斗或体育对抗中的 3D 恢复;
  • AR/VR 中的交互数字人;
  • 机器人对人类协作/接触状态的几何理解;
  • 影视、运动分析和交互动作标注;
  • 更广义的“foundation model 语义如何安全进入几何优化”研究。

7. 核心困难

  1. 严重人物互遮挡使 2D 关键点和身份对应不可靠;
  2. 单目输入无法直接确定两人的相对深度;
  3. VLM 的接触语义可能正确但对当前初始化没有增益,也可能因权重过大而有害;
  4. 效用依赖初始化器、优化器、接触权重和其他已激活边;
  5. 多视角、同序列和同 subject-pair 造成强相关样本,容易数据泄漏;
  6. 语义增量与 VLM 候选边身份本身携带的信息容易混淆;
  7. 单边效用不能自然推出多边组合的效用。

8. 目标会议与时间选择

推荐目标

  • Primary:ICCV 2027,提交时间待官方确认。 项目内部完成期限设为 2027-01-31,以留出投稿写作和补实验时间。
  • Backup:CVPR 2028 或下一届 3DV。 如果跨数据集和跨初始化器实验不足,3DV 比 CVPR/ICCV 更匹配几何重建与评测贡献。

明确排除的当前窗口

截至 2026-08-24,3DV 2027 截止 2026-08-28,ICRA 2027 截止 2026-09-15,ICASSP 2027 截止 2026-09-16。它们均不足以完成一个从 baseline 复现开始的顶会级新项目,不作为本项目首投目标。

9. 目标会议通常要求的贡献

CVPR/ICCV/ECCV 对此类项目通常要求:

  • 清晰且非拼接式的问题或机制创新;
  • 与最新 HMR、interaction reconstruction 和 VLM 方法公平比较;
  • 至少一个强标准数据集和一个泛化设置;
  • 机制消融,不把更强 backbone、更多数据或更多推理成本误归因为核心贡献;
  • 定量主结果、困难子集、失败案例、效率和统计可靠性;
  • 可复现代码、配置、数据协议和 checkpoint。

3DV 可以更接受高质量重建 benchmark、诊断和评价协议,但依然需要强 baseline 和明确的新知识。ICRA/RSS/CoRL 则需要更直接的机器人任务或具身后果;只做离线人体网格精化的 venue fit 偏弱。

10. 本项目明确不解决的问题

  • 不在首篇论文训练新的大 VLM;
  • 不进行通用多人拥挤场景重建,只研究两名主要交互者;
  • 不研究 human-object contact;
  • 不做动态衣物、头发或非参数化高频表面重建;
  • 不把视频时序 consistency 作为首篇主贡献;
  • 不把 75×75 contact signature 当作新表示;
  • 不做无限数量接触边的全组合搜索;
  • 不承诺常规 conformal 方法在跨数据集 shift 下仍有严格保证;
  • 不把“VLM 输出更自信”当作“约束更有用”。

11. 资源与工作假设

  • 计算:1 × NVIDIA RTX 5090,32GB 显存;
  • 存储:服务器数据盘约 158GB 可用;
  • 时间:假设 4–6 个月;
  • 团队:暂按一名主要研究者执行,导师/合作者能力尚未确认;
  • 数据:优先公开或可申请的 CHI3D、FlickrCI3D、Hi4D;
  • 标注:假设不进行昂贵的新人工标注,允许由 GT、受控扰动和 paired optimization 自动产生研究标签;
  • API:允许在 pilot 中使用闭源 VLM 或 ProsePose 缓存输出,但最终方法必须至少有一个公开可运行的 open-VLM 路径;
  • 训练:冻结 HMR 和 VLM,首版只训练轻量 utility selector。

12. 正确的效用定义

效用必须写成管线条件量:

[ u(e\mid I,X_0,\mathcal O,\lambda,L_{base},S,T), ]

其中 (e) 是候选接触边,(X_0) 是初始化,(\mathcal O) 是优化器,(\lambda) 是接触权重,(S) 是其他活动边集合,(T) 是优化预算。

标签不使用任意加权总分,优先采用:

  • helpful:主交互指标改善超过预注册最小差异,且所有安全指标非劣;
  • neutral:变化落入不可分辨区间;
  • harmful:主要目标显著恶化,或任一安全约束超过非劣界;
  • 同时保存所有连续 outcome deltas,供 ranking、regret 和敏感性分析使用。

13. Minimum Viable Research

范围

  • 50–100 个独立 interaction events;
  • 每个事件只选一个主视角进行首轮优化,其他视角只用于鲁棒性检查;
  • 一个公开 HMR 初始化器;
  • 一个 75-region 候选本体;
  • 单边或 top-1 决策;
  • 两个关键比较:geometry-only selector 和 geometry+VLM selector;
  • oracle contact、no-contact、ProsePose/APU-style 作为上下界和最近邻。

成功最低标准

  1. Oracle contact 相对 no-contact 显示可测 headroom;
  2. 语义选择器在固定候选边下,相对 geometry-only 在 AURC、AUPRC 或 matched-coverage HarmRate 至少有一个稳定优势,且事件级置信区间支持方向;
  3. use/abstain 相对无条件使用接触边降低有害更新;
  4. 结论不依赖随机图像切分。

若第 1 条失败,立即停止 utility selector;若第 2 条失败,转为 benchmark/negative-result 论文或终止方向。

14. Full Conference Version

  • CHI3D 主实验,Hi4D 外部 3D 泛化,FlickrCI3D 候选生成与接触识别;
  • 至少两个初始化器或两个接触损失配置;
  • 完整候选生成器 × 选择器二因素实验;
  • ProsePose、APU-style、BUDDI/ISP、强 HMR 初始化器、raw-confidence、sampling-agreement、geometry-only 和 oracle;
  • 单边与小集合边际效用;
  • flip/person-swap/paraphrase consistency;
  • 困难子集、反事实错误边、cross-subject、cross-dataset、cross-initializer;
  • cluster bootstrap、paired CI、三种随机种子用于学习型选择器;
  • 完整代码、配置、日志、缓存 VLM 输出、数据划分和失败案例库。

15. Stretch Version

  • shift-aware conformal risk control;
  • optimizer-invariant 或快速 surrogate utility;
  • 视频中的时变 trust 与 contact persistence;
  • facet/landmark 级双边接触对应和集合值歧义;
  • 开放词汇 contact ontology;
  • 将策略推广到 human-object 或 human-scene 语义约束。

16. 顶会理想标准

理想论文应同时给出三种证据:

  1. 现象证据: VLM 语义正确性和下游约束效用系统性错位;
  2. 方法证据: outcome-supervised selector 在固定候选边下优于几何、原始 confidence 和启发式一致性;
  3. 泛化证据: 风险降低至少跨一个未见 subject/domain 或另一优化上下文保持。

如果只能做到第 1 项,适合诊断/benchmark;做到 1+2 可形成强 3DV;做到 1+2+3 才具备更完整的 CVPR/ICCV 竞争力。