Skip to content

Latest commit

 

History

History
539 lines (388 loc) · 34.1 KB

File metadata and controls

539 lines (388 loc) · 34.1 KB

TrustContact:VLM 语义接触传感器调研与操作协议

检索截止: 2026-08-24
研究对象: 单张 RGB 双人交互图像中的 SMPL-X 接触候选、证据与下游约束效用
本阶段状态: 设计与 novelty audit 完成;尚无本地实验结果
证据口径: “已确认”表示由正式论文、作者项目页、官方仓库或官方模型卡确认;模型在本服务器上的速度、显存和任务准确率均仍需实测。

1. 结论先行

TrustContact 中 VLM 最合适的角色是:

冻结、可替换、可审计的语义接触传感器。 VLM 只产生候选接触边以及关于该候选的多视图/多提示证据;它不直接输出 SMPL-X,不直接决定接触 loss 权重,也不直接作最终 use/abstain。最终决策由使用 paired optimizer outcomes 监督的 utility selector 完成。

这个定位是合理的,但需要对原方案作四个关键修正:

  1. Qwen3-VL-8B-Instruct 是首选起点,不是未经实验即可冻结的“最佳模型”。 最终主模型必须由 contact-utility pilot 选择,而不是由通用 VQA 榜单选择。
  2. 候选生成、逐边验证、多次采样和结构化输出本身都不是足够创新。 ProsePose 已使用多次 LMM 采样和接触约束;ContactPrompt 已做多阶段结构化接触推理;REACT 已出现“距离候选 + VLM 验证”的人类接触过滤。
  3. 一致性不是正确性,更不是下游效用。 2026 年的 ViewDiag 直接发现空间 VLM 可以“稳定但错误”;因此 flip、swap、crop 和 paraphrase consistency 只能是 selector 特征,不能直接变成 use 规则。
  4. 核心 novelty 应是 intervention outcome。 标签回答的是“在固定初始化器、candidate、contact loss 和优化预算下,加入这条边是否改善最终几何且不破坏安全项”,不是“这条边在图像里像不像接触”。

当前最稳妥的模型组合是:

用途 冻结模型 当前判断
MVP 主候选 Qwen/Qwen3-VL-8B-Instruct 优先部署和测试;最终地位由 pilot 决定
同规模跨模型 OpenGVLab/InternVL3_5-8B-HF 测试证据接口和 selector 是否跨 VLM 迁移
真正的效率基线 openbmb/MiniCPM-V-4.6 1.3B,适合成本—效用曲线;替代笼统的“MiniCPM-V 系列”
闭源上界 固定日期 snapshot 的强视觉模型 只作 upper bound;严格缓存版本、成本和输出
最近工作复现 ProsePose 作者缓存的 GPT-4V 输出 用于严格重现,不作为 TrustContact 默认新传感器

2. 冻结的调研问题

  • VLRQ1: 在 1×RTX 5090 32GB 和本地批处理约束下,哪个开放 VLM 最适合 75-region 双人接触候选与验证?
  • VLRQ2: 候选生成、逐边验证、采样、paraphrase、horizontal flip、person swap 和 crop 各自提供什么证据,哪些会发生标签歧义、确认偏差或 outcome leakage?
  • VLRQ3: 现有工作已经覆盖了哪些 VLM×3D contact 机制;什么仍可能构成 TrustContact 的方法贡献?
  • VLRQ4: 怎样用一个小型、可证伪的实验选择 VLM,并证明 VLM 特征在固定候选边下具有 geometry-only 之外的增量?

3. 最近工作:哪些想法已经被覆盖

工作 已覆盖机制 对 TrustContact 的直接影响 状态
ProsePose / Pose Priors from Language Models LMM 产生身体部位接触约束;20 次采样;将接触转成优化 loss;处理空输出和手性问题 “VLM 生成 contact + 多次采样 + 优化”完全不能作为新颖性 CVPR 2025,已确认;官方代码与缓存
Ask, Pose, Unite LVLM contact、自报 confidence、2D 关键点距离、手性纠错、软接触 loss “confidence + geometry 决定权重”已有直接近邻;TrustContact 必须改为 outcome utility arXiv 2024;正式发表和代码仍待确认
GECO GPT 顺序推理预测语义人体部位与 human-scene contact ontology-constrained part contact 不是新问题 ECCV 2024 Workshops,已确认
InteractVLM Render–Localize–Lift;微调 VLM;人体与物体 3D 接触点;接触用于联合重建 “让 VLM 看结构化 3D/渲染提示并输出 contact”已有强先例 CVPR 2025,已确认
ContactPrompt 103 个手部语义区、vertex-grid visual prompt、free-form→part→dense 多阶段推理、结构化重试 “多阶段结构化接触推理”和“MLLM 稠密 3D contact”不能作为宽泛创新 arXiv 2026,代码承诺发布但未确认
SocialMirror 视频 VLM 描述、时序 joint-contact pairs、语义 motion infilling、几何/接触 refinement 双人接触对生成已存在;论文还明确提出 confidence、adaptive weighting 和 semantic–visual agreement 作为后续方向 arXiv 2026,代码未确认
VLM-Guided Group Preference Alignment VLM 对多个 mesh hypotheses 进行 critique/quality scoring,并构造偏好数据 “VLM 评价 3D mesh 好坏”已有;TrustContact 必须强调逐 edge intervention outcome CVPR 2026,已确认
REACT 距离产生候选;多视图渲染;VLM 将候选分类为真/假;接触用于人形机器人 retargeting “先候选、后 VLM 验证”已被直接覆盖;差异只能来自单图双人重建和 outcome-supervised use/abstain 2026 匿名在投,论文/代码尚未公开,作为 novelty watch 而非正式 baseline
LayoutVLM marked images、自一致解码、VLM 与可微 3D layout optimization visual marking 和 self-consistency 属通用 3D VLM 技术,不可单独声明新颖 CVPR 2025,已确认

已解决或高度拥挤的主张

  • VLM/MLLM 能从图像预测语义接触部位;
  • 预定义 ontology、结构化 JSON、多阶段 prompting;
  • 多次采样或自一致性降低随机输出噪声;
  • 接触约束可进入 SMPL/SMPL-X 优化;
  • VLM 可作为 mesh/pose critic;
  • 几何候选经过 VLM 语义过滤;
  • 自报 confidence 或可见性用于启发式权重。

当前尚未找到直接等价工作的主张

截至本轮检索,尚未发现工作同时满足:

  1. 单图双人 SMPL-X;
  2. 对固定候选 edge 进行同初始化 paired optimization;
  3. 用实际几何 outcome 定义 helpful/neutral/harmful;
  4. 学习 edge-level use/abstain;
  5. 在 matched coverage 下报告 HarmRate/AURC;
  6. 把 VLM 证据相对 geometry-only 的增量单独识别。

这是 TrustContact 目前最可信的 gap,但在 Gate B 通过前仍不能写“首次”。

4. 候选 VLM 的官方能力与部署边界

4.1 Qwen3-VL-8B-Instruct:MVP 第一候选

Qwen3-VL 官方仓库列出 2B/4B/8B/32B dense 系列,并提供 Transformers/vLLM 路径;8B Instruct 官方模型卡采用 Apache-2.0,仓库文件约 17.5GB。Qwen3-VL 还原生支持多图输入,技术报告强调空间—时间建模与 256K interleaved context,但这些通用 benchmark 能力不能替代本任务 pilot。Qwen3-VL technical report

推荐:

  • 使用 Instruct,不在 MVP 首先使用 Thinking;
  • BF16 或经过独立精度检查的 8-bit 版本;
  • Flash Attention;限制输入分辨率、图像数和输出长度;
  • 生成阶段允许受控采样,验证阶段用接近确定性的 forced choice;
  • 固定 HF revision/checkpoint hash,不使用浮动 main 生成论文结果。

风险:17.5GB 只是权重体积,不包含激活、视觉 tokens、KV cache 和服务框架开销。它在 32GB 5090 上“很可能可运行”,但批量、多图和高分辨率是否稳定必须实测,不能在论文中把推测写成结果。

4.2 InternVL3.5-8B-HF:同规模跨模型

InternVL3.5 官方仓库列出 8B 版本总参数约 8.5B,并同时提供自定义格式和标准 Hugging Face 格式;标准 HF 模型卡为 Apache-2.0。建议优先用 -HF,减少自定义 remote code 对长期复现的影响。

它不只是“另一个强模型”,而是用于回答:

  • selector 是否学习了通用的证据可靠性;
  • 还是只学习 Qwen 的输出语气、置信数字或 token 分布;
  • 只做少量 per-model calibration 是否能恢复迁移。

跨模型时禁止直接比较 raw logits/entropy。必须把 forced-choice margin、entropy 等在各模型 calibration split 内标准化,然后测试:

  1. Qwen 训练→InternVL 零样本;
  2. Qwen 训练→InternVL 只重标定;
  3. InternVL 完整重训。

4.3 MiniCPM-V 4.6:效率基线

用户原方案中的“MiniCPM-V 系列”需要冻结为明确版本。当前最合适的是 MiniCPM-V 4.6:官方说明它基于 SigLIP2-400M 与 Qwen3.5-0.8B,总规模约 1.3B,支持多图并提供 Transformers、vLLM、SGLang 和量化版本;官方模型卡为 Apache-2.0。

它是合理的效率基线,因为:

  • 参数规模明显小于两个 8B 候选;
  • 适合测试 selector 是否能从较弱但便宜的语义传感器中提取有用证据;
  • 可以形成 queries、延迟、显存、能耗/成本与 safe coverage 的 Pareto 曲线。

但不能根据官方通用榜单断言它的接触能力足够。细粒度肢体、左右和遮挡恰好可能是小模型最先丢失的能力。

4.4 闭源模型:只作 upper bound

若预算允许,可使用带固定日期 snapshot 的强闭源视觉模型。以 OpenAI 为例,官方 Responses API 支持图像输入,支持的模型可用 json_schema Structured Outputs 强制结构;这解决的是格式有效性,不保证身体部位或接触判断正确。官方图像输入示例、Structured Outputs API 说明

必须记录:模型 snapshot、调用日期、system/user prompt、图像 detail、温度、seed(若接口支持)、重试、token 与美元成本。闭源模型不提供可比较的隐藏 logits 时,不把该特征留空后直接喂给同一个 selector;应使用共同可得的行为特征,或为闭源模型单独训练/校准。

5. VLM 六类操作:保留、修改与否决

5.1 操作一:建立稳定 A/B 身份包

保留,但输入从“红/蓝框图”改为 identity packet:

  • 原始全图;
  • 细轮廓/边框标记的全图,标签放在人物框外侧,避免遮住接触位置;
  • 两人联合 crop;
  • 可选的 contact-site crop,必须同时包含两个端点;
  • person mask/track ID 作为 A/B 的真实身份锚点,禁止用“左边的人/右边的人”。

不要把单人 crop 用于判定两人是否接触,因为它移除了另一端证据;单人 crop 只可用于肢体定位、可见性和 laterality 辅助。

新增 marker-bias 消融:红/蓝对调、改用黄/青、只用 A/B 字母而不用颜色。若输出随颜色变化,说明所谓 person-swap inconsistency 可能只是视觉标记偏差。

5.2 操作二:生成 ontology 内候选边

保留冻结的 75-region ontology,但使用 canonical IDs,不让 VLM自由造词。建议把“是否为候选”和“接触状态”分开:

{
  "schema_version": "contact_sensor_v1",
  "person_map": {"A": "instance_007", "B": "instance_012"},
  "edges": [
    {
      "a_region_id": "A_L_HAND_03",
      "b_region_id": "B_R_FOREARM_02",
      "state": "contact",
      "visibility_a": "visible",
      "visibility_b": "partial",
      "evidence_mode": "visible_boundary_meeting",
      "self_reported_confidence": 0.72
    }
  ]
}

state 推荐为 contact | near_contact | separated | indeterminate。在任一端不可见时,除非有强反证,不应轻易输出 separated/no_contact;允许空 edge 集合。

MVP 的 top-K=3 合理,但完整实验必须测 K=1/3/5 的 candidate recall ceiling。否则 selector 的上限可能被候选阶段锁死。

5.3 操作三:逐边验证

保留 forced-choice verifier,但必须防确认偏差。不能只验证 proposer 自己提出的边;验证集还要含:

  • geometry-nearest candidates;
  • GT positive(仅 oracle/audit);
  • left/right swap;
  • A/B swap;
  • 邻近但错误的 body-region substitution;
  • 明显错误和困难 near-contact negatives。

推荐输出:

{
  "edge_id": "evt42_e07",
  "decision": "supported",
  "evidence_mode": "visible_boundary_meeting",
  "self_reported_confidence": 0.76
}

decision 为 supported | contradicted | indeterminate。验证提示中的候选顺序、A/B 叙述顺序和选项字母要随机化并记录,以检查 acquiescence/position bias。

对于开放模型,优先让答案为固定单 token 代码(如 A/B/C),从生成 scores 计算 option margin,再映射回语义标签。多词答案的 tokenization 不同,跨模型 raw logprob 不可直接比较。

5.4 操作四:受控多次采样

MVP 使用 5 次生成采样是成本与统计性的合理折中,但必须固定:

  • temperature/top_p;
  • 5 个明确 seed;
  • prompt version;
  • image packet hash;
  • model revision;
  • JSON parser/retry 行为。

可提取频率、离散熵、左右变更次数、identity 变更次数、contact↔indeterminate 转换次数。它们是证据特征,不是概率,也不是 utility 标签。

ProsePose 已证明多采样有用,因此“我们也采样 5 次”属于必要 baseline,不是方法贡献。

5.5 操作五:受控一致性探测

保留四类 probe,但必须定义变换群和标签映射:

  • Paraphrase: 预先冻结 3 个等义模板,不在测试后挑最稳定模板;
  • Horizontal flip: 保留 instance A/B,使用预注册映射 tau_flip 交换所有 left/right ontology IDs;
  • Person swap: 交换 A/B 标签或颜色,接触边端点随之交换;比较前把无向接触边 canonicalize;
  • Crop: 比较 raw full、marked full、joint-person crop、双端 contact-site crop。单人 crop 不参与接触存在性一致性。

一致性必须和正确性、utility 分开报告。空间 VLM 具有系统性 left/right 弱点,What's Up和 LRR-Bench均提供直接证据;更关键的是,Consistent Yet Wrong / ViewDiag显示跨视图稳定可能来自先验塌缩,而非视觉证据敏感性。因此:

consistency 高不能自动 use;consistency 低也不自动 abstain。它只能与真实 downstream outcome 建立经验关系后进入 selector。

5.6 操作六:形成 selector 证据向量

推荐的预干预 VLM 特征:

  • proposal frequency / normalized entropy;
  • verifier decision 与 option margin;
  • self-reported confidence(只作弱 baseline);
  • paraphrase/flip/person-swap/crop consistency;
  • left-right confusion count;
  • identity inconsistency count;
  • visibility state;
  • contradiction count;
  • JSON invalid/retry count;
  • query budget、模型 ID 和 probe mask。

推荐的预干预几何特征:

  • initial region-to-region minimum/robust distance;
  • initial penetration depth/volume;
  • initial 2D reprojection error;
  • candidate contact-gradient norm;
  • contact gradient 与基础 objective gradient 的 cosine;
  • relative-depth uncertainty;
  • occlusion ratio;
  • initializer confidence/visibility;
  • one-step linearized improvement estimate(若严格限定为加入约束前计算)。

禁止作为 selector 输入的 outcome leakage:

  • 完整优化后的 penetration change;
  • 加边后的最终 reprojection/contact/pose error;
  • optimizer convergence/success flag;
  • GT contact 或 GT mesh 派生量;
  • oracle best edge/weight;
  • 任何由同一 paired outcome 直接计算的统计量。

用户原列表中的 penetration change 必须从特征移到标签/评价;可以保留的是 initial penetration 或预先定义的一步线性化预测。

6. Utility 标签:论文最关键的区别

对事件 x、候选边 e 和优化上下文 c(initializer、loss、权重、迭代预算)定义两次配对运行:

  • O0 = Optimize(x, c, no_edge);
  • O1 = Optimize(x, c, add_edge=e)。

所有非接触项、初始化、随机性和预算保持一致。定义 outcome 差:

Delta_contact = metric_contact(O0) - metric_contact(O1)
Delta_pair    = metric_pair(O0)    - metric_pair(O1)
Delta_pose    = metric_pose(O0)    - metric_pose(O1)
Delta_pen     = metric_pen(O0)     - metric_pen(O1)

正值表示改善。三类标签由预注册门槛产生:

  • helpful: 主 interaction/contact 指标改善,且 pose、reprojection、penetration 等安全项均不越过非劣界;
  • harmful: 任一主要安全项明显恶化,或综合 utility 低于 harm margin;
  • neutral: outcome 差落在优化噪声/等价区间内。

先重复运行 no-edge 与一部分 edge,估计 optimizer 本身的方差,再冻结 neutral band。否则微小数值噪声会被错误当成监督标签。

7. VLM 选型实验:100 个独立事件,而不是 100 张随机图片

7.1 数据与拆分

  • 100 个不重叠 interaction events;同一事件的相机、帧和 subject pair 不跨 split;
  • 20 events 用于 prompt/schema/debug,不进入选型数字;
  • 80 events 作为 locked pilot;
  • 分层覆盖:明确接触、near/no-contact、重遮挡、小接触区域、laterality 困难和 person overlap;
  • 最终论文 test events 与这 100 个事件隔离。

7.2 公平协议

  • 三个模型接收完全相同的 identity packet、ontology、prompt 语义和 query budget;
  • 候选生成阶段分别比较 recall@K/precision@K;
  • 验证阶段使用所有生成器和 geometry union 后的同一 fixed candidate bank;
  • 每个模型独立 calibration,不直接比较 raw confidence/logit 数值;
  • 全部输出缓存并以 event/model/revision/prompt/transform/seed 唯一寻址。

7.3 指标分层

传感器准确性: edge precision/recall/F1、body-region accuracy、laterality error、A/B swap error。
格式与稳定性: JSON validity、empty rate、retry rate、paraphrase/flip/swap/crop consistency。
效用判别: utility AUPRC/AUROC、Spearman、geometry→geometry+VLM 的增量、matched-coverage HarmRate、AURC。
效率: 每图/每 edge 延迟、峰值显存、输入/输出 tokens、每事件总 query 数、闭源成本。

7.4 主选型规则

主要指标不是 contact F1,而是:

在固定 candidate bank 上,加入该 VLM 的证据后,相比 geometry-only 能否稳定改善 harmful/helpful discrimination 和 matched-coverage downstream risk。

推荐采用 one-standard-error rule:若多个模型的主 utility 指标差异在一个标准误内,选择更快、显存更低、JSON 更稳定的模型。这样 MiniCPM-V 即使不是 contact F1 第一,也可能成为更好的部署传感器。

7.5 Go / No-Go

  • VLM selection Go: 至少一个模型的 geometry+VLM 相对 geometry-only 在 locked pilot 上主指标方向一致,cluster bootstrap CI 不支持“完全无增量”,且 safe coverage 不是靠几乎全 abstain 得到;
  • Qwen 主模型 Go: Qwen 位于最佳 utility 组,或按 one-standard-error rule 以效率/稳定性胜出;
  • No-Go: 所有模型只有 contact F1 提升而没有 fixed-candidate utility 增量。此时保留 geometry selector,把 VLM 方向降级为负结果/benchmark,不训练更复杂 VLM 模块。

8. 哪些可以成为“VLM 上的创新”

8.1 不应作为核心创新

  • A/B 彩框或 Set-of-Marks;
  • 75-region ontology;
  • JSON schema;
  • generate-then-verify;
  • 5/20 次采样;
  • self-reported confidence;
  • prompt paraphrase、flip 或 swap augmentation;
  • 直接把 confidence 变成 contact loss weight;
  • 让更大 VLM 替换较小 VLM。

8.2 最推荐的核心贡献:Outcome-Calibrated Contact Sensing

不是改 VLM backbone,而是建立一个可替换传感器接口,把 VLM 的生成、验证和 perturbation evidence 与实际 optimizer intervention outcome 对齐。创新实体是:

  1. 条件 edge utility 数据与标签协议;
  2. fixed-candidate residual-value 识别;
  3. selective use/abstain 与 no-harm evaluation。

这最符合 TrustContact,也最能与 ProsePose/APU/REACT 区分。

8.3 有潜力的支持创新:接触专用群等变证据

把 person permutation S2 与 horizontal reflection C2 定义为明确的 contact-edge 变换,测量模型是否遵循预期映射;但贡献必须是:

这种残差等变误差能否在控制 geometry、sampling entropy 和 candidate identity 后,额外预测 downstream harm。

单纯报告 flip accuracy 不足。还要用 ViewDiag 式反例证明模型不会只是“稳定地答错”。

8.4 有潜力但需二次 audit:3D 反事实接触验证

可把初始双人 SMPL-X 按候选边高亮,从少量标准视角渲染,询问 VLM“该 3D 假设与原图是否一致”。它可能比只看 RGB 更接近实际 intervention。

风险很高:InteractVLM 已有 Render–Localize–Lift;ContactPrompt 已用 mesh visual prompts;LayoutVLM 使用 marked images;VLM-Guided GPA 已让 VLM critique mesh hypotheses。因此新颖性必须限定为“candidate-edge counterfactual + outcome calibration”,不能声明首次让 VLM 看 3D 渲染。

建议放 Full/Stretch,不进入首轮 MVP。

8.5 有价值的系统创新:预算自适应查询

先运行一次 proposer 和一次 verifier;只有 selector epistemic uncertainty 高时,才追加 flip/swap/paraphrase/crop probes。评价 safe coverage 与 query cost 的 Pareto 前沿。

它能显著降低 5×采样和多变换成本,但属于效率支持贡献,不能取代核心 outcome utility。

8.6 跨 VLM 证据标准化

定义模型无关的 evidence schema,并用 per-model calibration 将 entropy、margin、invalid rate 等映射到统一尺度。若 Qwen 训练的 selector 只重标定即可迁移到 InternVL/MiniCPM,这会成为很强的泛化结果;若完全不能迁移,也能形成“证据可靠性是 model-specific”的有价值边界结论。

9. 推荐的 MVP 查询预算

每个事件:

  1. 原图 + marked full + joint crop,Qwen proposer 采样 5 次;
  2. 合并、canonicalize 后最多保留 3 条 VLM 候选;
  3. 对 fixed candidate bank 中每条边进行一次接近确定性的 forced-choice verification;
  4. 首轮只追加 3 个固定 paraphrases、1 次 flip、1 次 person swap;
  5. crop consistency 仅使用 full/joint/contact-site 三类包含双端的视图;
  6. 全部 JSON、token scores、图像 hashes 和解析状态离线缓存;
  7. VLM 完全冻结,不参与反向传播;
  8. selector 先用 logistic regression,再用两层 MLP;复杂模型只有超过简单模型才保留。

为了控制成本,可把变换 probe 限制在 top-3 candidates,而不是对 75×75 所有边查询。

10. 需要新增的实验与消融

ID 实验 回答的问题 关键控制
VLM-S00 三模型 100-event audit 哪个 VLM 最有 downstream utility evidence fixed candidates、同 query budget
VLM-S01 Raw vs marked vs joint/contact-site crop 标记和裁剪是否改善 grounding,还是引入颜色偏差 同图同 prompt
VLM-S02 proposer-only vs proposer+verifier verifier 是否有真增量 含 proposer positives、随机/对抗 negatives
VLM-S03 N=1/3/5/10 sampling 采样收益与成本何时饱和 相同模型和 candidate K
VLM-S04 paraphrase/flip/swap/crop feature ablation 哪类一致性预测 harm fixed edge、geometry controls
VLM-S05 consistency→contact truth vs consistency→utility 一致性到底预测什么 同一事件 cluster statistics
VLM-S06 self-confidence vs token margin vs calibrated evidence 自报 confidence 是否可用 validation-only calibration
VLM-S07 Qwen→InternVL/MiniCPM transfer selector 是通用还是 model-specific raw/standardized/recalibrated 三种特征
VLM-S08 balanced verification negatives 是否存在确认偏差 正负/困难负例、选项顺序随机化
VLM-S09 query budget cascade 能否以更少查询保持 safe coverage 相同 HarmRate target
VLM-S10 3D highlighted-render counterfactual 3D 提示是否带来 RGB 之外增量 同 candidate、同 selector、同总 tokens

11. 风险排序

风险 等级 原因 修复
被评为 ProsePose/APU + classifier Major 方法表面结构非常接近 以 outcome dataset、fixed-candidate identification、HarmRate/AURC 为论文主轴
generate-then-verify 被 REACT 覆盖 Major 任务虽不同,机制已出现 不把 verifier 当贡献;强调 optimizer utility 和 single-image reconstruction
consistency 高但错误 Major 已有直接空间 VLM 证据 一致性只作 feature;必须与 truth/utility 双重标定
outcome leakage Critical if present penetration change 等会直接泄露标签 只允许 pre-intervention features;自动 schema audit
Qwen 不是任务最佳模型 Medium 通用榜单不代表接触效用 100-event model selection;主模型由规则选出
标记/颜色遮挡接触 Medium 视觉 prompt 可能改变证据 原图与细轮廓同时输入;marker-bias ablation
cross-VLM feature 不可比 Medium logits、entropy、语气尺度不同 per-model standardization 与 calibration
75-region 太粗 Medium 手指/小面积接触无法区分 首篇保持标准 ontology;dense hand 只作局限/Stretch

12. 本阶段 Gate 判定

本阶段结论

  • VLM 作为冻结语义传感器的定位成立;
  • Qwen3-VL-8B-Instruct 是合理的首个部署对象,但还不是已证实的最终主模型;
  • MiniCPM-V 效率基线应明确为 1.3B 的 4.6;
  • generate/verify、结构化推理和多采样已被近邻覆盖;
  • outcome-supervised utility 与 fixed-candidate no-harm evaluation 仍是当前最可信的差异。

当前证据

证据来自 ProsePose、APU、GECO、InteractVLM、ContactPrompt、SocialMirror、VLM-Guided GPA、REACT,以及空间一致性/校准文献;模型版本、许可和部署路径来自各官方仓库与模型卡。

当前风险

Gate 2 仍然未通过。Gate-A2 已证明 safety-aware optimizer 下仍保留 aggregate oracle contact headroom;当前剩余原因是尚未证明:

  1. VLM evidence 在固定候选边下超过 geometry-only;
  2. use/abstain 在非零 coverage 下确实降低 HarmRate。

2026-08-25 更新:原 Gate-A 已证明 contact headroom,但 full gate 因 penetration safety 失败;O1 冻结标签为 21 helpful / 6 neutral / 23 harmful。该结果只证明 selective-decision problem 存在,不证明 VLM 能预测 utility。

下一阶段任务

  1. 取得 CHI3D 原始图像,并冻结不与 Gate-A/A2 cohort 混用的 VLM audit pool;
  2. 完成 PromptHMR/Multi-HMR baseline gate;
  3. 在服务器冻结三个开放 VLM 的 revision 和推理环境;
  4. 建立 20-event prompt debug + locked audit,再运行 VLM-S00;
  5. 在任何完整 selector 训练前完成 leakage audit;
  6. 每月检查 REACT 的正式论文/代码,以及 ContactPrompt、SocialMirror、InterMesh 的代码发布状态。

13. Gate-V0 DEBUG20 实测更新(2026-08-26)

Qwen3-VL-8B-Instruct 的首个冻结 smoke 已完成,结论是 不能进入 locked model selection。v1 和 v2 的负样本预检暴露示例复制与无接触幻觉;版本化 修复后的 v3 在 20 张 Hi4D DEBUG20、每图 5 次采样上实现 100% JSON validity、 100% A/B compliance 和零 edge-cap violation,但冻结 contact-only gate 的 balanced accuracy 为 0.444、coarse-edge precision 为 0,且 laterality 无样本 可评估,最终 gate_pass=false。

失败后、明确不参与 Gate 判定的候选诊断显示:若把 near_contact 也视为 proposer candidate,事件级 balanced accuracy 为 0.899,但 coarse-edge precision 仅 0.10。这一分离很关键:Qwen 可能识别“这两个人附近存在交互/接触风险”, 却不能可靠定位具体 A/B 身体部位。因此当前数据支持 VLM 是 high-recall noisy candidate sensor 的有限假设,不支持它是可直接施加 loss 的 contact oracle。

接下来只允许在同一 DEBUG20 上做平衡 fixed-edge verification:候选集合必须同时 包含 GT-positive、proposer-positive、geometry near-contact 和左右/A-B/远距离 counterfactual negatives;verifier 用近确定性解码,并报告 TPR、TNR、region precision、option-order bias 和 abstention。只有它在预先冻结门槛下修复细粒度 grounding,才有资格运行 LOCKED80 或构造 selector utility 数据。

14. Gate-V0b–V0e verifier 实测结论(2026-08-26)

上述 fixed-edge repair 已执行完毕并关闭,不能再写成“待验证的推荐方案”。

  1. 直接逐边 decision 不可靠。 同一真边和假边,support-first prompt 都给 supported,falsification-first prompt 都给 contradicted。定位 overlay 没有改变该结果,说明 prompt polarity 大于图像证据。
  2. 把 decision 移出 VLM 是必要但不充分的。 中性 evidence schema 消除了 大部分直接极性冲突,但固定规则的 coverage 降为 0;模型倾向把所有关系写成 depth ambiguity,或在措辞变化下同时给出 ambiguity/gap。
  3. joint marker 不是足够的 body-surface grounding。 PromptHMR 的 OpenPose BODY-25 关节必须按正确 convention 使用;即便修正,关节圆点和骨架粗管也不 表示真实 contact surface。
  4. predicted mesh-surface render 仍未救回 verifier。 使用 SMPL-X→SMPL sparse transfer、coarse segmentation 和联合 z-buffer 得到可见 surface,保持 prompt、 candidates 与 rule 不变后,dev coverage 仍为 0;无 visible surface 时模型还会 在两份 prompt 中分别报告 meeting 与 gap。
  5. 3D contact truth 与单图证据必须分开。 新建的 Camera04 visibility proxy 证明当前四条正边具有较高的 z-buffer endpoint visibility,但 neutral-SMPL 重投影和 silhouette 仍有误差,因此只能用于 difficulty stratification,不能 当官方可见性标签。

因此,当前最稳妥的 VLM 定位进一步收缩为:冻结的高噪声候选/语义证据源, 不能充当最终 verifier。 reported_confidence、sampling agreement、paraphrase consistency、joint/surface response 都只允许作为 selector feature;它们必须在 真实 optimizer outcome 上证明相对 geometry-only 的增量。下一实验不再是换 prompt 或换 VLM,而是 Gate-B paired intervention dataset。跨 VLM 只在该增量 成立后恢复。

15. Gate-B geometry-first pilot 更新(2026-08-26)

已从安全通过的 Gate-A2 optimizer context 中导出 18 个真实 top-1 contact interventions,并沿用冻结 utility margins 得到 8 helpful / 2 neutral / 8 harmful。 无泄漏 geometry-only logistic 在 leave-one-interaction-family-out 下达到 harmful AP 0.714、ROC-AUC 0.688;25% coverage 的 4 个低风险事件中 HarmRate 为 0。 这个结果说明 outcome 标签和 geometry control 的管线可以工作,但 cohort 已被 用于 Gate-A2 safety confirmation,因此只允许写成开发性结果,且对简单 contact-loss baseline 的 bootstrap 增量仍不稳定。

现有 Qwen evidence 不能被加入上述模型:它来自 Hi4D,而 utility labels 来自 CHI3D,事件交集为 0。TrustContact 的核心比较必须是同一 image、同一 A/B、同一 candidate edge 和同一 optimizer context 下的 geometry 与 geometry+VLM。 下一步不是训练 selector,而是在 Hi4D 上打通 2-event/4-edge optimizer smoke, 冻结 coarse semantic region 到 75 SMPL-X patch 的映射后再生成对齐 labels。

16. Gate-B Hi4D aligned outcome 更新(2026-08-26)

上述 2-event/4-edge smoke 与 full intervention 已完成。coarse semantic region 通过 sparse SMPL-X→SMPL transfer 的几何质量映射到 r75;smoke 的 8 个 O0/O1 cells 全部通过初始化、边数、gradient、重复性与数值有限性审计。随后同四条候选 以冻结的 1000×2 HHCS optimizer 运行,得到 1 helpful / 2 neutral / 1 harmful。

最重要的机制观察不是平均提升,而是四种语义—效用组合同时出现:GT-positive 候选既可能 helpful,也可能 neutral;counterfactual 候选既可能 neutral,也可能 harmful。最严重的 false edge 使真实 contact correspondence 变差 47.34 mm, relative pelvis error 变差 96.42 mm。这支持 TrustContact 的任务定义:selector 必须预测“加入此边后的 outcome”,不能只预测“该边语义上是否接触”。

V0d/V0e 的离线 Qwen evidence 已按 candidate/event/image/edge 精确 join,但固定 规则对 4/4 候选均 abstain,coverage=0。prompt disagreement 在此小样本中覆盖唯一 harmful,但也覆盖一个 neutral,而且二者属于同一 event。因此当前结论严格为:

  • aligned VLM residual 管线已打通;
  • 当前 fixed verifier 没有 useful coverage;
  • n=4、2 events 不允许训练或评价 selector;
  • gate_b_semantic_residual_pass=false,LOCKED80 与跨模型实验继续冻结。

后续扩大 development cohort 时,必须按 event 分组,先冻结 geometry-only,再在 完全相同 candidates/outcomes 上加入缓存的 sampling、agreement、surface relation 和 confidence features。只有 held-out event 上出现增量,VLM 才能恢复为论文主张。