除 Engineering Risk 和 Publication Risk 外,其余分数越高越好;两项 risk 的 10 表示风险最高。分数是基于机制和已核验文献的项目决策分,不是实验结果。
缩写:N=Novelty,S=Significance,F=Feasibility,E=Evaluability,D=Data availability,ER=Engineering risk,PR=Publication risk,AC=Ablation clarity,NRV=Negative-result value。
| ID | 候选 gap | N | S | F | E | D | ER | PR | AC | NRV | 裁决 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| G1 | 条件下游 contact-constraint utility 与 selective abstention | 8 | 9 | 8 | 9 | 7 | 5 | 4 | 9 | 10 | 主线 |
| G2 | 固定候选边后,VLM evidence 相对 geometry-only 的 residual value | 7 | 9 | 9 | 10 | 8 | 3 | 4 | 10 | 10 | 主线、决定性机制检验 |
| G3 | utility selector 跨 initializer/loss/domain 的可迁移边界 | 7 | 8 | 6 | 8 | 6 | 7 | 5 | 8 | 9 | 完整论文的泛化主线 |
| G4 | 接触集合的边际效用与非加性交互 | 8 | 8 | 5 | 7 | 6 | 8 | 6 | 7 | 7 | Full/Stretch;MVP 只做 top-1 |
| G5 | 人物置换与镜像一致的 contact grounding | 7 | 7 | 8 | 9 | 8 | 4 | 7 | 9 | 6 | 作为 feature/stress test,不单独成贡献 |
| G6 | 遮挡下 facet/landmark 双边接触对应的歧义集合 | 6 | 7 | 4 | 5 | 5 | 9 | 8 | 6 | 6 | 首篇删除;75×75 已被 ISP 覆盖 |
| G7 | 视频中 contact trust 的时变状态与持续性 | 7 | 8 | 4 | 7 | 7 | 9 | 7 | 7 | 8 | 后续论文;SocialMirror 已占据近邻路线 |
| G8 | open-vocabulary contact ontology 到有限身体区域的校准映射 | 6 | 7 | 6 | 6 | 8 | 7 | 8 | 6 | 7 | 可能被视为 ontology engineering |
| G9 | 用轻量 surrogate 替代昂贵 paired optimization 的效用估计 | 8 | 8 | 5 | 8 | 7 | 8 | 6 | 8 | 7 | 在 utility benchmark 成立后才有意义 |
| G10 | grouped/domain-shift 条件下的 contact risk control | 7 | 8 | 5 | 7 | 5 | 8 | 6 | 8 | 8 | Stretch;不能直接套普通 conformal |
现有方法已做: ProsePose 依据空输出和采样分歧回退,APU 用 LVLM confidence 与 2D 距离加权;SelectiveNet、Decision-Focused Learning 等提供一般拒绝和效用框架。
具体缺失: 据当前检索,尚未发现双人 SMPL-X 工作将单条 VLM contact edge 进行同初始化、有边/无边的配对优化,直接用下游 outcome 监督 use/abstain,并以 HarmRate 和 risk–coverage 为主评价。
所需新机制: paired optimizer-intervention labels、条件 utility selector、no-harm policy。
审稿风险: 若最终方法只是 temperature scaling 或二分类 MLP,会被认为是 ProsePose/APU 后处理。benchmark、标签定义和二因素实验必须成为主体。
现有方法已做: ProsePose/APU 同时利用语义与几何,但没有完全固定候选边来隔离两者;InterMesh 使用显式 interaction semantics,但不进行逐边可识别性分析。
具体缺失: 候选 edge identity 本身就携带语义。若不固定候选集合,geometry-only selector 与 VLM selector 的比较不能回答“语言是否提供新增信息”。
所需新机制: candidate generator × selector 的二因素设计、反事实错误边和 outcome-supervised residual analysis。
价值: 即使结果为零,也能给出可重复的负结论,避免社区继续把更强 VLM 当成默认收益。
现有方法已做: 多数 contact-guided 方法在固定 initializer/loss 上评价;一般 calibration 方法常假设 train/cal/test 可交换。
具体缺失: 尚不清楚 utility selector 是学习普遍的 semantic-geometric compatibility,还是只记住某个 optimizer、权重和初始化误差分布。
所需新机制: context-aware utility definition、跨 initializer/loss/domain 评价、少量重校准与 transfer analysis。
风险: 这一项实验量较大,完整版本至少只改变一个 initializer 或一个 loss;不要同时承诺全域通用。
现有 VLM-guided HMR 多依据模型输出、confidence 或几何 proxy 决定约束强度,缺少直接以优化后结果为监督的逐约束安全决策。
在固定的双人 SMPL-X 初始化器、接触损失和优化预算下,使用 paired optimizer outcomes 训练的选择器,能否比无条件接触、raw VLM confidence、sampling agreement 和 geometry-only gate 更准确地识别 harmful contact edges,并在相同 coverage 下改善下游重建?
直接监督 conditional downstream utility 的选择器将比监督 VLM correctness 或使用启发式 confidence 更接近真实优化风险,因此在 matched coverage 下具有更低 HarmRate 和更优 risk–coverage,同时保留 oracle contact 所揭示的交互几何收益。
- Independent Variable: contact policy:none、always-use、raw confidence、sampling agreement、geometry-only、outcome-supervised full selector、oracle;
- Dependent Variables: HarmRate、AURC、utility AUPRC、relative-root/global pair error、contact precision/recall、penetration、per-person pose non-inferiority;
- Control Variables: 图像、候选边、initializer checkpoint、相机协议、optimizer、初始化、loss 权重、迭代数、随机种子和评价代码。
选择器学习“接触边与当前几何状态/优化方向是否兼容”,而不是仅学习 VLM 是否自信。use/abstain 避免对高风险样本施加强语义正则。
- oracle contact 相比 no-contact 没有 headroom;或
- fixed candidate bank 下,full selector 不优于 geometry-only/raw confidence;或
- HarmRate 的降低完全由更低 coverage 解释;或
- 一换 seed/subject split,效果方向不稳定。
在预注册事件级 split 上,full selector 相对主要简单控制在 utility discrimination 和 matched-coverage downstream risk 上均显示稳定优势,且 pose/penetration 非劣。
VLM evidence 不能改善效用识别,或 selector 的收益只来自几何、候选质量或更低 coverage。
建立首个系统性的 contact-constraint harm benchmark,并证明现有 VLM 置信度/一致性不足以作为几何优化信任信号。
现有比较通常同时改变候选 edge 和选择策略,无法确定收益来自 VLM 语义还是候选集合本身。
当所有模型面对相同的候选 contact edges 时,VLM 多次采样、改写、镜像和人物交换一致性,是否在初始 2D/3D 几何、可见性和梯度特征之外提供可重复的效用预测增量?
VLM 的变换一致性残差能暴露 laterality、person identity 和语义 hallucination,而这些错误不能由局部距离单独识别,因此在高遮挡、左右混淆和训练外交互子集上提供 residual value。
- Independent Variable: feature set:geometry only、semantics only、geometry+raw confidence、geometry+sampling、geometry+all consistency;
- Dependent Variables: utility AUPRC/AUROC、AURC、HarmRate、conditional mutual/predictive gain、困难子集表现;
- Control Variables: 完全固定候选边、模型容量、训练样本、split、threshold selection 和后续优化。
同一语义在 paraphrase/flip/person-swap 后应满足已知映射;违反映射比单次 confidence 更能指示 grounding 不稳定。
- 语义特征在 fixed candidates 下没有增量;
- 增量只发生在随机图像 split,在 event/subject split 消失;
- 普通 flip/swap augmentation 达到同样结果;
- 更强 geometry/contact detector 完全消除语义收益。
正结果支持“VLM uncertainty 对 constraint utility 有补充信息”;负结果支持“当前 VLM 接触语义只是昂贵的候选生成器,不能稳定判断使用价值”。两者都可形成清晰结论。
constraint utility 依赖优化上下文,但现有 HMR 工作很少显式测量这种依赖。
在 source initializer/loss/domain 上学习和校准的 utility selector,迁移到未见 subject、另一数据集或另一 initializer/contact weight 后,ranking 与 calibration 分别保留多少;少量 target calibration 是否足以恢复风险控制?
语义一致性和可见性特征具有一定可迁移性,绝对概率 calibration 则会随 optimizer/initializer shift 退化;context features 或少量目标域重校准应能恢复部分风险—覆盖率表现。
- Independent Variable: source/target context、是否重校准、是否输入 context descriptor;
- Dependent Variables: cross-context AUPRC、calibration error、AURC、HarmRate、coverage、ranking correlation;
- Control Variables: 固定测试事件、候选集合和评价目标;每次只改变一个上下文因素。
selector 在任何 context change 下都降到 random/geometry baseline,且少量 calibration 无法恢复;此时不能声称通用 trust estimator。
量化 utility 的 optimizer-specific 边界,说明后续系统必须按管线重标定而不能复用通用 confidence。
与根据 VLM 自信度或几何近邻直接施加接触约束不同,TrustContact 使用同初始化 paired optimization 得到的条件下游效用监督接触决策,并在固定候选边下学习 use/abstain,从而显式控制双人 SMPL-X 精化中的有害语义约束。
在 Gate A/B 通过前,不能写“首次”或“显著降低”。
| # | 风险 | 等级 | 当前防线 |
|---|---|---|---|
| F1 | 方法可能被评为 ProsePose/APU + 小分类器/校准,且 generate-then-verify 已受 REACT 威胁 | MAJOR | 以 utility benchmark、条件标签、fixed-candidate 识别实验和 no-harm protocol 为主体;不把 verifier 当贡献;明确继承 decision-focused/selective 谱系 |
| F8 | benchmark、utility model、等变性、集合建模、conformal、视频和稠密 contact 同时进入一篇导致失焦 | MAJOR | 首篇只保留 utility benchmark + selector + risk protocol;top-1 MVP;其余作为 stress test 或 stretch |
当前无已知 CRITICAL flaw,但两个 MAJOR 风险意味着 verdict 仍为 Accept with Revisions,pending oracle-headroom and semantic-residual pilots。
| Baseline | 角色 | 状态 | 复现优先级 | 备注 |
|---|---|---|---|---|
| BEV | 历史多人 camera-depth 初始化器 | 官方代码可用 | P1 | 与 ProsePose/BUDDI pipeline 兼容,利于原论文复现 |
| Multi-HMR | 开源 whole-body SMPL-X 初始化器 | 官方代码可用 | P1 | 作为更现代的 initializer,需适配 interaction metrics |
| Multi-HMR 2 | 最新 camera-centric 候选 | arXiv,代码待确认 | P3 | 只有 checkpoint/代码可用后才进入实验 |
| AiOS | all-in-one expressive HPS 候选 | 代码待审计 | P3 | 用于验证 initializer choice 是否主导结论 |
| PromptHMR | promptable HMR/foundation baseline | 推理资源部分可用,训练状态待审计 | P2 | 比较 semantic prompt,但需确保输出和许可可用 |
| Baseline | 角色 | 状态 | 复现优先级 | 公平比较意义 |
|---|---|---|---|---|
| No refinement | 原始 initializer | 可直接实现 | P0 | 测量任何 optimization 是否真正有用 |
| Geometry-only refinement | 2D keypoint/prior/penetration,无 semantic contact | 可基于 ProsePose/BUDDI 实现 | P0 | 所有接触方法的共同基础 |
| ISP contact signature | 专用视觉 contact predictor | 数据/模型运行待审计 | P1 | 不使用语言的强 contact generator |
| BUDDI | 双人 generative proxemics prior | 官方代码可用 | P1 | image-based close interaction 强标准路线 |
| CloseInt/CloseApp | 视频、proxemics/physics/appearance | 官方代码可用 | P3 | 输入不完全相同,只做相邻/视频扩展,不与单图主表混排 |
| InterMesh | 显式 interaction semantics end-to-end HMR | arXiv,代码待确认 | P2/P3 | 最新 novelty threat;若代码可用应纳入强比较 |
| Baseline | 实现 | 复现优先级 | 必须控制的变量 |
|---|---|---|---|
| ProsePose | 官方代码与 cached LMM outputs | P0 | 同一 initializer、同一 candidate ontology、同一 optimizer |
| APU-style | 按论文重实现 confidence × 2D distance | P1 | VLM 输出、2D detector 和 loss 权重保持一致 |
| Qwen3-VL-8B direct prompt | 统一 ontology 的 proposer/verifier | P0 | 只是主传感器候选,不默认是最佳模型;必须通过 locked utility audit |
| InternVL3.5-8B-HF direct prompt | 同 schema 的跨模型传感器 | P0 | raw logits 不跨模型比较;per-model calibration |
| MiniCPM-V 4.6 direct prompt | 1.3B 效率传感器 | P0 | 同 query budget,并报告 safe coverage–cost Pareto |
| Raw VLM confidence | threshold 或直接 use | P0 | threshold 只能由 validation/calibration 选择 |
| Sampling agreement | 多次生成一致率 | P0 | 与 TrustContact 使用相同采样次数和 API 成本 |
| Flip/person-swap/paraphrase heuristic | 规则一致性分数 | P1 | 区分规则方法与学习型 selector 的必要性 |
| VLM-Guided GPA | mesh-hypothesis critic | P3 | 任务粒度不同;代码可用时做补充,不强行改造成 edge method |
| Adapting HMR with VLM Feedback | single-person pose-text diffusion | P3 | 正式代码未确认,主要作 related work/概念边界 |
| ContactPrompt-style | free-form→part→dense 结构化 contact | P2/P3 | 任务为手—物、论文用闭源 API;主要证明多阶段结构化推理已不是空白 |
| REACT | geometry candidates→multi-view VLM true/false filter | novelty watch | 匿名在投且代码未公开;不能当可复现 baseline,但必须在 related work/投稿前跟踪 |
VLM 版本、许可、结构化输出边界和 100-event 选型协议见 04_vlm_contact_sensor_study.md 与 tables/vlm_model_audit.csv。
- Random edge / random abstention,coverage matched;
- Always use all edges;
- Use top-1 VLM confidence;
- Logistic regression on geometry;
- Logistic regression on semantics;
- Geometry + semantics feature concatenation;
- Temperature scaling、isotonic regression、beta calibration;
- Gradient compatibility only;
- Learned MLP selector;
- Oracle helpfulness、oracle best edge、oracle best subset。
复杂模型必须超过 logistic regression、isotonic 和规则一致性,否则不应保留。
- VLM contact edges;
- ISP/visual-contact edges;
- 初始 mesh 几何近邻;
- 受控反事实 edges:chirality swap、person swap、body-part substitution、no-contact;
- union candidate bank;
- GT/oracle,仅用于上界。
- none/always;
- raw confidence;
- geometry-only;
- semantics-only;
- geometry+semantic consistency;
- oracle utility。
主机制表必须固定 candidate bank 后比较 selector;候选生成能力放在另一张表,禁止混成一个结果。
- 同一图像、同一人物框、同一初始化 mesh;
- 同一 candidate bank;
- 同一 optimizer、迭代数、接触 loss 和基础 loss;
- VLM baseline 使用相同模型、prompt、采样次数和缓存;
- threshold/calibration 只看 calibration split;
- 不允许 optimization outcome feature 进入 selector;
- dataset split 以 interaction event/sequence/subject-pair 为单位;
- 同一事件的不同相机必须位于同一 split;
- 多条边和多帧以 cluster 统计,不能当独立样本;
- 主结果报告 paired effect、cluster bootstrap CI 和 matched-coverage comparison;
- 外部 checkpoint 和额外数据逐项披露;
- API 成本和多次 sampling 成本计入效率表。
在 MVP 前至少真实跑通四项:
- PromptHMR interaction-off/on,这是 CHI3D/Hi4D 上最高优先级的当前强 baseline;
- Multi-HMR,并在共享 body joints 与统一相机协议下评测;
- BUDDI/geometry-only interaction optimization;
- ProsePose 官方 pipeline 与 cached outputs;
- BEV fresh inference 或严格标注的 cached-initializer track。
ISP、CRMH 或 APU-style 用于 contact/physics 机制补充;只有真实复现后才进入统一数值表。完整顶会 baseline 冻结清单见 05_top_conference_baseline_audit.md。
每项都需要记录 commit hash、environment、checkpoint、dataset version、preprocessing、seed、GPU、runtime、原结果、本地结果和差异原因。
三个 RQ 形成了一个可证伪链条:先确认 contact 有 oracle headroom,再确认 VLM evidence 有 geometry 之外的残差,最后测量该残差能否跨优化上下文迁移。任何一步失败都会改变论文主张,而不是通过增加模块掩盖失败。
部分完成但尚未通过。 新颖性主张已可写清,顶会 baseline 审计、
optimizer noise、50-event oracle intervention 与 Gate-A2 safety control 已完成。
原 Gate-A penetration safety 失败保持不变;Gate-A2 已在审计过的
hhcmap=0.10, hhcgen=0.03 context 和 18-event reserve 上通过。因此仍缺:
- PromptHMR 等最新 baseline 的统一可运行结果;
- fixed-candidate semantic residual pilot;
- raw CHI3D 图像和真实 VLM evidence;
- matched-coverage selector 结果。
当前冻结标签在 O1 上得到 21 helpful / 6 neutral / 23 harmful,说明研究对象存在,但不能把“标签存在”写成“selector 有效”。在上述前置完成前,不进入大规模 utility dataset 生成或完整模型训练。