Skip to content

Latest commit

 

History

History
299 lines (196 loc) · 18.2 KB

File metadata and controls

299 lines (196 loc) · 18.2 KB

TrustContact 候选 Gaps、Research Questions 与 Baseline 方案

1. Gap 评分规则

除 Engineering Risk 和 Publication Risk 外,其余分数越高越好;两项 risk 的 10 表示风险最高。分数是基于机制和已核验文献的项目决策分,不是实验结果。

缩写:N=Novelty,S=Significance,F=Feasibility,E=Evaluability,D=Data availability,ER=Engineering risk,PR=Publication risk,AC=Ablation clarity,NRV=Negative-result value。

ID 候选 gap N S F E D ER PR AC NRV 裁决
G1 条件下游 contact-constraint utility 与 selective abstention 8 9 8 9 7 5 4 9 10 主线
G2 固定候选边后,VLM evidence 相对 geometry-only 的 residual value 7 9 9 10 8 3 4 10 10 主线、决定性机制检验
G3 utility selector 跨 initializer/loss/domain 的可迁移边界 7 8 6 8 6 7 5 8 9 完整论文的泛化主线
G4 接触集合的边际效用与非加性交互 8 8 5 7 6 8 6 7 7 Full/Stretch;MVP 只做 top-1
G5 人物置换与镜像一致的 contact grounding 7 7 8 9 8 4 7 9 6 作为 feature/stress test,不单独成贡献
G6 遮挡下 facet/landmark 双边接触对应的歧义集合 6 7 4 5 5 9 8 6 6 首篇删除;75×75 已被 ISP 覆盖
G7 视频中 contact trust 的时变状态与持续性 7 8 4 7 7 9 7 7 8 后续论文;SocialMirror 已占据近邻路线
G8 open-vocabulary contact ontology 到有限身体区域的校准映射 6 7 6 6 8 7 8 6 7 可能被视为 ontology engineering
G9 用轻量 surrogate 替代昂贵 paired optimization 的效用估计 8 8 5 8 7 8 6 8 7 在 utility benchmark 成立后才有意义
G10 grouped/domain-shift 条件下的 contact risk control 7 8 5 7 5 8 6 8 8 Stretch;不能直接套普通 conformal

2. 选中的三个 gap

G1:下游结果监督的约束决策

现有方法已做: ProsePose 依据空输出和采样分歧回退,APU 用 LVLM confidence 与 2D 距离加权;SelectiveNet、Decision-Focused Learning 等提供一般拒绝和效用框架。

具体缺失: 据当前检索,尚未发现双人 SMPL-X 工作将单条 VLM contact edge 进行同初始化、有边/无边的配对优化,直接用下游 outcome 监督 use/abstain,并以 HarmRate 和 risk–coverage 为主评价。

所需新机制: paired optimizer-intervention labels、条件 utility selector、no-harm policy。

审稿风险: 若最终方法只是 temperature scaling 或二分类 MLP,会被认为是 ProsePose/APU 后处理。benchmark、标签定义和二因素实验必须成为主体。

G2:语义相对几何的可识别增量

现有方法已做: ProsePose/APU 同时利用语义与几何,但没有完全固定候选边来隔离两者;InterMesh 使用显式 interaction semantics,但不进行逐边可识别性分析。

具体缺失: 候选 edge identity 本身就携带语义。若不固定候选集合,geometry-only selector 与 VLM selector 的比较不能回答“语言是否提供新增信息”。

所需新机制: candidate generator × selector 的二因素设计、反事实错误边和 outcome-supervised residual analysis。

价值: 即使结果为零,也能给出可重复的负结论,避免社区继续把更强 VLM 当成默认收益。

G3:效用的上下文依赖与迁移边界

现有方法已做: 多数 contact-guided 方法在固定 initializer/loss 上评价;一般 calibration 方法常假设 train/cal/test 可交换。

具体缺失: 尚不清楚 utility selector 是学习普遍的 semantic-geometric compatibility,还是只记住某个 optimizer、权重和初始化误差分布。

所需新机制: context-aware utility definition、跨 initializer/loss/domain 评价、少量重校准与 transfer analysis。

风险: 这一项实验量较大,完整版本至少只改变一个 initializer 或一个 loss;不要同时承诺全域通用。

3. Research Question 1:条件效用与拒绝

Research Gap

现有 VLM-guided HMR 多依据模型输出、confidence 或几何 proxy 决定约束强度,缺少直接以优化后结果为监督的逐约束安全决策。

Research Question

在固定的双人 SMPL-X 初始化器、接触损失和优化预算下,使用 paired optimizer outcomes 训练的选择器,能否比无条件接触、raw VLM confidence、sampling agreement 和 geometry-only gate 更准确地识别 harmful contact edges,并在相同 coverage 下改善下游重建?

Research Hypothesis H1

直接监督 conditional downstream utility 的选择器将比监督 VLM correctness 或使用启发式 confidence 更接近真实优化风险,因此在 matched coverage 下具有更低 HarmRate 和更优 risk–coverage,同时保留 oracle contact 所揭示的交互几何收益。

变量

  • Independent Variable: contact policy:none、always-use、raw confidence、sampling agreement、geometry-only、outcome-supervised full selector、oracle;
  • Dependent Variables: HarmRate、AURC、utility AUPRC、relative-root/global pair error、contact precision/recall、penetration、per-person pose non-inferiority;
  • Control Variables: 图像、候选边、initializer checkpoint、相机协议、optimizer、初始化、loss 权重、迭代数、随机种子和评价代码。

Expected Mechanism

选择器学习“接触边与当前几何状态/优化方向是否兼容”,而不是仅学习 VLM 是否自信。use/abstain 避免对高风险样本施加强语义正则。

Falsification Condition

  • oracle contact 相比 no-contact 没有 headroom;或
  • fixed candidate bank 下,full selector 不优于 geometry-only/raw confidence;或
  • HarmRate 的降低完全由更低 coverage 解释;或
  • 一换 seed/subject split,效果方向不稳定。

支持假设的结果

在预注册事件级 split 上,full selector 相对主要简单控制在 utility discrimination 和 matched-coverage downstream risk 上均显示稳定优势,且 pose/penetration 非劣。

否定假设的结果

VLM evidence 不能改善效用识别,或 selector 的收益只来自几何、候选质量或更低 coverage。

假设失败仍有价值的结论

建立首个系统性的 contact-constraint harm benchmark,并证明现有 VLM 置信度/一致性不足以作为几何优化信任信号。

4. Research Question 2:语义的 residual value

Research Gap

现有比较通常同时改变候选 edge 和选择策略,无法确定收益来自 VLM 语义还是候选集合本身。

Research Question

当所有模型面对相同的候选 contact edges 时,VLM 多次采样、改写、镜像和人物交换一致性,是否在初始 2D/3D 几何、可见性和梯度特征之外提供可重复的效用预测增量?

Research Hypothesis H2

VLM 的变换一致性残差能暴露 laterality、person identity 和语义 hallucination,而这些错误不能由局部距离单独识别,因此在高遮挡、左右混淆和训练外交互子集上提供 residual value。

变量

  • Independent Variable: feature set:geometry only、semantics only、geometry+raw confidence、geometry+sampling、geometry+all consistency;
  • Dependent Variables: utility AUPRC/AUROC、AURC、HarmRate、conditional mutual/predictive gain、困难子集表现;
  • Control Variables: 完全固定候选边、模型容量、训练样本、split、threshold selection 和后续优化。

Expected Mechanism

同一语义在 paraphrase/flip/person-swap 后应满足已知映射;违反映射比单次 confidence 更能指示 grounding 不稳定。

Falsification Condition

  • 语义特征在 fixed candidates 下没有增量;
  • 增量只发生在随机图像 split,在 event/subject split 消失;
  • 普通 flip/swap augmentation 达到同样结果;
  • 更强 geometry/contact detector 完全消除语义收益。

正负结果价值

正结果支持“VLM uncertainty 对 constraint utility 有补充信息”;负结果支持“当前 VLM 接触语义只是昂贵的候选生成器,不能稳定判断使用价值”。两者都可形成清晰结论。

5. Research Question 3:跨上下文迁移

Research Gap

constraint utility 依赖优化上下文,但现有 HMR 工作很少显式测量这种依赖。

Research Question

在 source initializer/loss/domain 上学习和校准的 utility selector,迁移到未见 subject、另一数据集或另一 initializer/contact weight 后,ranking 与 calibration 分别保留多少;少量 target calibration 是否足以恢复风险控制?

Research Hypothesis H3

语义一致性和可见性特征具有一定可迁移性,绝对概率 calibration 则会随 optimizer/initializer shift 退化;context features 或少量目标域重校准应能恢复部分风险—覆盖率表现。

变量

  • Independent Variable: source/target context、是否重校准、是否输入 context descriptor;
  • Dependent Variables: cross-context AUPRC、calibration error、AURC、HarmRate、coverage、ranking correlation;
  • Control Variables: 固定测试事件、候选集合和评价目标;每次只改变一个上下文因素。

Falsification Condition

selector 在任何 context change 下都降到 random/geometry baseline,且少量 calibration 无法恢复;此时不能声称通用 trust estimator。

假设失败仍有价值的结论

量化 utility 的 optimizer-specific 边界,说明后续系统必须按管线重标定而不能复用通用 confidence。

6. 一句话论文主张候选

与根据 VLM 自信度或几何近邻直接施加接触约束不同,TrustContact 使用同初始化 paired optimization 得到的条件下游效用监督接触决策,并在固定候选边下学习 use/abstain,从而显式控制双人 SMPL-X 精化中的有害语义约束。

在 Gate A/B 通过前,不能写“首次”或“显著降低”。

7. Fatal-flaws audit

# 风险 等级 当前防线
F1 方法可能被评为 ProsePose/APU + 小分类器/校准,且 generate-then-verify 已受 REACT 威胁 MAJOR 以 utility benchmark、条件标签、fixed-candidate 识别实验和 no-harm protocol 为主体;不把 verifier 当贡献;明确继承 decision-focused/selective 谱系
F8 benchmark、utility model、等变性、集合建模、conformal、视频和稠密 contact 同时进入一篇导致失焦 MAJOR 首篇只保留 utility benchmark + selector + risk protocol;top-1 MVP;其余作为 stress test 或 stretch

当前无已知 CRITICAL flaw,但两个 MAJOR 风险意味着 verdict 仍为 Accept with Revisions,pending oracle-headroom and semantic-residual pilots。

8. Baseline 分层

8.1 初始化器和标准任务 baseline

Baseline 角色 状态 复现优先级 备注
BEV 历史多人 camera-depth 初始化器 官方代码可用 P1 与 ProsePose/BUDDI pipeline 兼容,利于原论文复现
Multi-HMR 开源 whole-body SMPL-X 初始化器 官方代码可用 P1 作为更现代的 initializer,需适配 interaction metrics
Multi-HMR 2 最新 camera-centric 候选 arXiv,代码待确认 P3 只有 checkpoint/代码可用后才进入实验
AiOS all-in-one expressive HPS 候选 代码待审计 P3 用于验证 initializer choice 是否主导结论
PromptHMR promptable HMR/foundation baseline 推理资源部分可用,训练状态待审计 P2 比较 semantic prompt,但需确保输出和许可可用

8.2 interaction/contact baseline

Baseline 角色 状态 复现优先级 公平比较意义
No refinement 原始 initializer 可直接实现 P0 测量任何 optimization 是否真正有用
Geometry-only refinement 2D keypoint/prior/penetration,无 semantic contact 可基于 ProsePose/BUDDI 实现 P0 所有接触方法的共同基础
ISP contact signature 专用视觉 contact predictor 数据/模型运行待审计 P1 不使用语言的强 contact generator
BUDDI 双人 generative proxemics prior 官方代码可用 P1 image-based close interaction 强标准路线
CloseInt/CloseApp 视频、proxemics/physics/appearance 官方代码可用 P3 输入不完全相同,只做相邻/视频扩展,不与单图主表混排
InterMesh 显式 interaction semantics end-to-end HMR arXiv,代码待确认 P2/P3 最新 novelty threat;若代码可用应纳入强比较

8.3 语言/VLM 最近邻 baseline

Baseline 实现 复现优先级 必须控制的变量
ProsePose 官方代码与 cached LMM outputs P0 同一 initializer、同一 candidate ontology、同一 optimizer
APU-style 按论文重实现 confidence × 2D distance P1 VLM 输出、2D detector 和 loss 权重保持一致
Qwen3-VL-8B direct prompt 统一 ontology 的 proposer/verifier P0 只是主传感器候选,不默认是最佳模型;必须通过 locked utility audit
InternVL3.5-8B-HF direct prompt 同 schema 的跨模型传感器 P0 raw logits 不跨模型比较;per-model calibration
MiniCPM-V 4.6 direct prompt 1.3B 效率传感器 P0 同 query budget,并报告 safe coverage–cost Pareto
Raw VLM confidence threshold 或直接 use P0 threshold 只能由 validation/calibration 选择
Sampling agreement 多次生成一致率 P0 与 TrustContact 使用相同采样次数和 API 成本
Flip/person-swap/paraphrase heuristic 规则一致性分数 P1 区分规则方法与学习型 selector 的必要性
VLM-Guided GPA mesh-hypothesis critic P3 任务粒度不同;代码可用时做补充,不强行改造成 edge method
Adapting HMR with VLM Feedback single-person pose-text diffusion P3 正式代码未确认,主要作 related work/概念边界
ContactPrompt-style free-form→part→dense 结构化 contact P2/P3 任务为手—物、论文用闭源 API;主要证明多阶段结构化推理已不是空白
REACT geometry candidates→multi-view VLM true/false filter novelty watch 匿名在投且代码未公开;不能当可复现 baseline,但必须在 related work/投稿前跟踪

VLM 版本、许可、结构化输出边界和 100-event 选型协议见 04_vlm_contact_sensor_study.md 与 tables/vlm_model_audit.csv。

8.4 简单 selector baseline

  • Random edge / random abstention,coverage matched;
  • Always use all edges;
  • Use top-1 VLM confidence;
  • Logistic regression on geometry;
  • Logistic regression on semantics;
  • Geometry + semantics feature concatenation;
  • Temperature scaling、isotonic regression、beta calibration;
  • Gradient compatibility only;
  • Learned MLP selector;
  • Oracle helpfulness、oracle best edge、oracle best subset。

复杂模型必须超过 logistic regression、isotonic 和规则一致性,否则不应保留。

9. 候选生成器 × 选择器二因素协议

Candidate Generator

  • VLM contact edges;
  • ISP/visual-contact edges;
  • 初始 mesh 几何近邻;
  • 受控反事实 edges:chirality swap、person swap、body-part substitution、no-contact;
  • union candidate bank;
  • GT/oracle,仅用于上界。

Selector

  • none/always;
  • raw confidence;
  • geometry-only;
  • semantics-only;
  • geometry+semantic consistency;
  • oracle utility。

主机制表必须固定 candidate bank 后比较 selector;候选生成能力放在另一张表,禁止混成一个结果。

10. 统一公平比较协议

  1. 同一图像、同一人物框、同一初始化 mesh;
  2. 同一 candidate bank;
  3. 同一 optimizer、迭代数、接触 loss 和基础 loss;
  4. VLM baseline 使用相同模型、prompt、采样次数和缓存;
  5. threshold/calibration 只看 calibration split;
  6. 不允许 optimization outcome feature 进入 selector;
  7. dataset split 以 interaction event/sequence/subject-pair 为单位;
  8. 同一事件的不同相机必须位于同一 split;
  9. 多条边和多帧以 cluster 统计,不能当独立样本;
  10. 主结果报告 paired effect、cluster bootstrap CI 和 matched-coverage comparison;
  11. 外部 checkpoint 和额外数据逐项披露;
  12. API 成本和多次 sampling 成本计入效率表。

11. Baseline 复现的最低集合

在 MVP 前至少真实跑通四项:

  1. PromptHMR interaction-off/on,这是 CHI3D/Hi4D 上最高优先级的当前强 baseline;
  2. Multi-HMR,并在共享 body joints 与统一相机协议下评测;
  3. BUDDI/geometry-only interaction optimization;
  4. ProsePose 官方 pipeline 与 cached outputs;
  5. BEV fresh inference 或严格标注的 cached-initializer track。

ISP、CRMH 或 APU-style 用于 contact/physics 机制补充;只有真实复现后才进入统一数值表。完整顶会 baseline 冻结清单见 05_top_conference_baseline_audit.md。

每项都需要记录 commit hash、environment、checkpoint、dataset version、preprocessing、seed、GPU、runtime、原结果、本地结果和差异原因。

12. 本阶段结论

三个 RQ 形成了一个可证伪链条:先确认 contact 有 oracle headroom,再确认 VLM evidence 有 geometry 之外的残差,最后测量该残差能否跨优化上下文迁移。任何一步失败都会改变论文主张,而不是通过增加模块掩盖失败。

13. Gate 2 状态

部分完成但尚未通过。 新颖性主张已可写清,顶会 baseline 审计、 optimizer noise、50-event oracle intervention 与 Gate-A2 safety control 已完成。 原 Gate-A penetration safety 失败保持不变;Gate-A2 已在审计过的 hhcmap=0.10, hhcgen=0.03 context 和 18-event reserve 上通过。因此仍缺:

  • PromptHMR 等最新 baseline 的统一可运行结果;
  • fixed-candidate semantic residual pilot;
  • raw CHI3D 图像和真实 VLM evidence;
  • matched-coverage selector 结果。

当前冻结标签在 O1 上得到 21 helpful / 6 neutral / 23 harmful,说明研究对象存在,但不能把“标签存在”写成“selector 有效”。在上述前置完成前,不进入大规模 utility dataset 生成或完整模型训练。