冻结日期: 2026-08-24
版本: v0.1,文献与 MVP 设计阶段
项目位于以下交叉方向:
- multi-person whole-body human mesh recovery;
- close human-human interaction reconstruction;
- SMPL-X contact modelling;
- vision-language priors for 3D human understanding;
- decision-focused learning、selective prediction 与 risk control。
项目的论文类型首先是 Novel Problem / Evaluation Protocol,其次才是轻量方法。它不是“把 VLM 接到 SMPL-X 后面”的组合型论文。
在严重遮挡和深度歧义的双人交互图像中,能否依据一条 VLM 接触约束对指定 SMPL-X 重建管线的条件下游效用来决定使用或拒绝,并在固定候选边后证明 VLM 证据相对纯几何证据具有可测的增量价值?
给定一张含两名近距离交互人物的 RGB 图像,首先由冻结的 HMR 初始化器恢复两个人的 SMPL-X;随后由多个候选生成器产生身体区域接触边;选择器只利用优化前可得的几何、可见性和 VLM 一致性证据,预测每条边在指定优化管线中的 helpful / neutral / harmful 状态,并执行 use/abstain;最后用被接受的边精化相对位置、姿态与接触几何。
- 单张 RGB 图像;
- 两个人的检测框或分割结果;
- 冻结 HMR 初始化器产生的两个 SMPL-X;
- 候选接触边集合;
- 可选的相机内参。若不可用,由初始化器估计或使用统一估计协议。
- 两个人的 SMPL-X 参数与相机坐标位置;
- 每条候选边的条件效用分数或三分类概率;
- use/abstain 决策;
- 精化后的双人网格;
- 可审计的拒绝原因特征,例如低采样一致性、镜像冲突或几何不兼容。
flowchart LR
A["RGB image"] --> B["Frozen two-person SMPL-X initializer"]
A --> C1["VLM candidate edges"]
A --> C2["ISP or visual-contact candidates"]
B --> C3["Geometric-neighbour candidates"]
C1 --> D["Fixed candidate bank"]
C2 --> D
C3 --> D
B --> E["Pre-optimization geometry and gradients"]
A --> F["VLM sampling, paraphrase, flip and person-swap consistency"]
D --> G["Conditional utility selector"]
E --> G
F --> G
G --> H{"Use or abstain"}
H -->|use top-1 or bounded set| I["Contact-aware SMPL-X refinement"]
H -->|abstain| J["Return base reconstruction"]
B --> K["Paired optimizer interventions during label generation"]
D --> K
K --> L["Helpful, neutral, harmful labels and continuous deltas"]
L --> G
- 两人瑜伽、舞蹈、拥抱、搀扶、格斗或体育对抗中的 3D 恢复;
- AR/VR 中的交互数字人;
- 机器人对人类协作/接触状态的几何理解;
- 影视、运动分析和交互动作标注;
- 更广义的“foundation model 语义如何安全进入几何优化”研究。
- 严重人物互遮挡使 2D 关键点和身份对应不可靠;
- 单目输入无法直接确定两人的相对深度;
- VLM 的接触语义可能正确但对当前初始化没有增益,也可能因权重过大而有害;
- 效用依赖初始化器、优化器、接触权重和其他已激活边;
- 多视角、同序列和同 subject-pair 造成强相关样本,容易数据泄漏;
- 语义增量与 VLM 候选边身份本身携带的信息容易混淆;
- 单边效用不能自然推出多边组合的效用。
- Primary:ICCV 2027,提交时间待官方确认。 项目内部完成期限设为 2027-01-31,以留出投稿写作和补实验时间。
- Backup:CVPR 2028 或下一届 3DV。 如果跨数据集和跨初始化器实验不足,3DV 比 CVPR/ICCV 更匹配几何重建与评测贡献。
截至 2026-08-24,3DV 2027 截止 2026-08-28,ICRA 2027 截止 2026-09-15,ICASSP 2027 截止 2026-09-16。它们均不足以完成一个从 baseline 复现开始的顶会级新项目,不作为本项目首投目标。
CVPR/ICCV/ECCV 对此类项目通常要求:
- 清晰且非拼接式的问题或机制创新;
- 与最新 HMR、interaction reconstruction 和 VLM 方法公平比较;
- 至少一个强标准数据集和一个泛化设置;
- 机制消融,不把更强 backbone、更多数据或更多推理成本误归因为核心贡献;
- 定量主结果、困难子集、失败案例、效率和统计可靠性;
- 可复现代码、配置、数据协议和 checkpoint。
3DV 可以更接受高质量重建 benchmark、诊断和评价协议,但依然需要强 baseline 和明确的新知识。ICRA/RSS/CoRL 则需要更直接的机器人任务或具身后果;只做离线人体网格精化的 venue fit 偏弱。
- 不在首篇论文训练新的大 VLM;
- 不进行通用多人拥挤场景重建,只研究两名主要交互者;
- 不研究 human-object contact;
- 不做动态衣物、头发或非参数化高频表面重建;
- 不把视频时序 consistency 作为首篇主贡献;
- 不把 75×75 contact signature 当作新表示;
- 不做无限数量接触边的全组合搜索;
- 不承诺常规 conformal 方法在跨数据集 shift 下仍有严格保证;
- 不把“VLM 输出更自信”当作“约束更有用”。
- 计算:1 × NVIDIA RTX 5090,32GB 显存;
- 存储:服务器数据盘约 158GB 可用;
- 时间:假设 4–6 个月;
- 团队:暂按一名主要研究者执行,导师/合作者能力尚未确认;
- 数据:优先公开或可申请的 CHI3D、FlickrCI3D、Hi4D;
- 标注:假设不进行昂贵的新人工标注,允许由 GT、受控扰动和 paired optimization 自动产生研究标签;
- API:允许在 pilot 中使用闭源 VLM 或 ProsePose 缓存输出,但最终方法必须至少有一个公开可运行的 open-VLM 路径;
- 训练:冻结 HMR 和 VLM,首版只训练轻量 utility selector。
效用必须写成管线条件量:
[ u(e\mid I,X_0,\mathcal O,\lambda,L_{base},S,T), ]
其中 (e) 是候选接触边,(X_0) 是初始化,(\mathcal O) 是优化器,(\lambda) 是接触权重,(S) 是其他活动边集合,(T) 是优化预算。
标签不使用任意加权总分,优先采用:
- helpful:主交互指标改善超过预注册最小差异,且所有安全指标非劣;
- neutral:变化落入不可分辨区间;
- harmful:主要目标显著恶化,或任一安全约束超过非劣界;
- 同时保存所有连续 outcome deltas,供 ranking、regret 和敏感性分析使用。
- 50–100 个独立 interaction events;
- 每个事件只选一个主视角进行首轮优化,其他视角只用于鲁棒性检查;
- 一个公开 HMR 初始化器;
- 一个 75-region 候选本体;
- 单边或 top-1 决策;
- 两个关键比较:geometry-only selector 和 geometry+VLM selector;
- oracle contact、no-contact、ProsePose/APU-style 作为上下界和最近邻。
- Oracle contact 相对 no-contact 显示可测 headroom;
- 语义选择器在固定候选边下,相对 geometry-only 在 AURC、AUPRC 或 matched-coverage HarmRate 至少有一个稳定优势,且事件级置信区间支持方向;
- use/abstain 相对无条件使用接触边降低有害更新;
- 结论不依赖随机图像切分。
若第 1 条失败,立即停止 utility selector;若第 2 条失败,转为 benchmark/negative-result 论文或终止方向。
- CHI3D 主实验,Hi4D 外部 3D 泛化,FlickrCI3D 候选生成与接触识别;
- 至少两个初始化器或两个接触损失配置;
- 完整候选生成器 × 选择器二因素实验;
- ProsePose、APU-style、BUDDI/ISP、强 HMR 初始化器、raw-confidence、sampling-agreement、geometry-only 和 oracle;
- 单边与小集合边际效用;
- flip/person-swap/paraphrase consistency;
- 困难子集、反事实错误边、cross-subject、cross-dataset、cross-initializer;
- cluster bootstrap、paired CI、三种随机种子用于学习型选择器;
- 完整代码、配置、日志、缓存 VLM 输出、数据划分和失败案例库。
- shift-aware conformal risk control;
- optimizer-invariant 或快速 surrogate utility;
- 视频中的时变 trust 与 contact persistence;
- facet/landmark 级双边接触对应和集合值歧义;
- 开放词汇 contact ontology;
- 将策略推广到 human-object 或 human-scene 语义约束。
理想论文应同时给出三种证据:
- 现象证据: VLM 语义正确性和下游约束效用系统性错位;
- 方法证据: outcome-supervised selector 在固定候选边下优于几何、原始 confidence 和启发式一致性;
- 泛化证据: 风险降低至少跨一个未见 subject/domain 或另一优化上下文保持。
如果只能做到第 1 项,适合诊断/benchmark;做到 1+2 可形成强 3DV;做到 1+2+3 才具备更完整的 CVPR/ICCV 竞争力。