检索截止: 2026-08-24
研究对象: 单张 RGB 双人交互图像中的 SMPL-X 接触候选、证据与下游约束效用
本阶段状态: 设计与 novelty audit 完成;尚无本地实验结果
证据口径: “已确认”表示由正式论文、作者项目页、官方仓库或官方模型卡确认;模型在本服务器上的速度、显存和任务准确率均仍需实测。
TrustContact 中 VLM 最合适的角色是:
冻结、可替换、可审计的语义接触传感器。 VLM 只产生候选接触边以及关于该候选的多视图/多提示证据;它不直接输出 SMPL-X,不直接决定接触 loss 权重,也不直接作最终 use/abstain。最终决策由使用 paired optimizer outcomes 监督的 utility selector 完成。
这个定位是合理的,但需要对原方案作四个关键修正:
- Qwen3-VL-8B-Instruct 是首选起点,不是未经实验即可冻结的“最佳模型”。 最终主模型必须由 contact-utility pilot 选择,而不是由通用 VQA 榜单选择。
- 候选生成、逐边验证、多次采样和结构化输出本身都不是足够创新。 ProsePose 已使用多次 LMM 采样和接触约束;ContactPrompt 已做多阶段结构化接触推理;REACT 已出现“距离候选 + VLM 验证”的人类接触过滤。
- 一致性不是正确性,更不是下游效用。 2026 年的 ViewDiag 直接发现空间 VLM 可以“稳定但错误”;因此 flip、swap、crop 和 paraphrase consistency 只能是 selector 特征,不能直接变成 use 规则。
- 核心 novelty 应是 intervention outcome。 标签回答的是“在固定初始化器、candidate、contact loss 和优化预算下,加入这条边是否改善最终几何且不破坏安全项”,不是“这条边在图像里像不像接触”。
当前最稳妥的模型组合是:
| 用途 | 冻结模型 | 当前判断 |
|---|---|---|
| MVP 主候选 | Qwen/Qwen3-VL-8B-Instruct |
优先部署和测试;最终地位由 pilot 决定 |
| 同规模跨模型 | OpenGVLab/InternVL3_5-8B-HF |
测试证据接口和 selector 是否跨 VLM 迁移 |
| 真正的效率基线 | openbmb/MiniCPM-V-4.6 |
1.3B,适合成本—效用曲线;替代笼统的“MiniCPM-V 系列” |
| 闭源上界 | 固定日期 snapshot 的强视觉模型 | 只作 upper bound;严格缓存版本、成本和输出 |
| 最近工作复现 | ProsePose 作者缓存的 GPT-4V 输出 | 用于严格重现,不作为 TrustContact 默认新传感器 |
- VLRQ1: 在 1×RTX 5090 32GB 和本地批处理约束下,哪个开放 VLM 最适合 75-region 双人接触候选与验证?
- VLRQ2: 候选生成、逐边验证、采样、paraphrase、horizontal flip、person swap 和 crop 各自提供什么证据,哪些会发生标签歧义、确认偏差或 outcome leakage?
- VLRQ3: 现有工作已经覆盖了哪些 VLM×3D contact 机制;什么仍可能构成 TrustContact 的方法贡献?
- VLRQ4: 怎样用一个小型、可证伪的实验选择 VLM,并证明 VLM 特征在固定候选边下具有 geometry-only 之外的增量?
| 工作 | 已覆盖机制 | 对 TrustContact 的直接影响 | 状态 |
|---|---|---|---|
| ProsePose / Pose Priors from Language Models | LMM 产生身体部位接触约束;20 次采样;将接触转成优化 loss;处理空输出和手性问题 | “VLM 生成 contact + 多次采样 + 优化”完全不能作为新颖性 | CVPR 2025,已确认;官方代码与缓存 |
| Ask, Pose, Unite | LVLM contact、自报 confidence、2D 关键点距离、手性纠错、软接触 loss | “confidence + geometry 决定权重”已有直接近邻;TrustContact 必须改为 outcome utility | arXiv 2024;正式发表和代码仍待确认 |
| GECO | GPT 顺序推理预测语义人体部位与 human-scene contact | ontology-constrained part contact 不是新问题 | ECCV 2024 Workshops,已确认 |
| InteractVLM | Render–Localize–Lift;微调 VLM;人体与物体 3D 接触点;接触用于联合重建 | “让 VLM 看结构化 3D/渲染提示并输出 contact”已有强先例 | CVPR 2025,已确认 |
| ContactPrompt | 103 个手部语义区、vertex-grid visual prompt、free-form→part→dense 多阶段推理、结构化重试 | “多阶段结构化接触推理”和“MLLM 稠密 3D contact”不能作为宽泛创新 | arXiv 2026,代码承诺发布但未确认 |
| SocialMirror | 视频 VLM 描述、时序 joint-contact pairs、语义 motion infilling、几何/接触 refinement | 双人接触对生成已存在;论文还明确提出 confidence、adaptive weighting 和 semantic–visual agreement 作为后续方向 | arXiv 2026,代码未确认 |
| VLM-Guided Group Preference Alignment | VLM 对多个 mesh hypotheses 进行 critique/quality scoring,并构造偏好数据 | “VLM 评价 3D mesh 好坏”已有;TrustContact 必须强调逐 edge intervention outcome | CVPR 2026,已确认 |
| REACT | 距离产生候选;多视图渲染;VLM 将候选分类为真/假;接触用于人形机器人 retargeting | “先候选、后 VLM 验证”已被直接覆盖;差异只能来自单图双人重建和 outcome-supervised use/abstain | 2026 匿名在投,论文/代码尚未公开,作为 novelty watch 而非正式 baseline |
| LayoutVLM | marked images、自一致解码、VLM 与可微 3D layout optimization | visual marking 和 self-consistency 属通用 3D VLM 技术,不可单独声明新颖 | CVPR 2025,已确认 |
- VLM/MLLM 能从图像预测语义接触部位;
- 预定义 ontology、结构化 JSON、多阶段 prompting;
- 多次采样或自一致性降低随机输出噪声;
- 接触约束可进入 SMPL/SMPL-X 优化;
- VLM 可作为 mesh/pose critic;
- 几何候选经过 VLM 语义过滤;
- 自报 confidence 或可见性用于启发式权重。
截至本轮检索,尚未发现工作同时满足:
- 单图双人 SMPL-X;
- 对固定候选 edge 进行同初始化 paired optimization;
- 用实际几何 outcome 定义 helpful/neutral/harmful;
- 学习 edge-level use/abstain;
- 在 matched coverage 下报告 HarmRate/AURC;
- 把 VLM 证据相对 geometry-only 的增量单独识别。
这是 TrustContact 目前最可信的 gap,但在 Gate B 通过前仍不能写“首次”。
Qwen3-VL 官方仓库列出 2B/4B/8B/32B dense 系列,并提供 Transformers/vLLM 路径;8B Instruct 官方模型卡采用 Apache-2.0,仓库文件约 17.5GB。Qwen3-VL 还原生支持多图输入,技术报告强调空间—时间建模与 256K interleaved context,但这些通用 benchmark 能力不能替代本任务 pilot。Qwen3-VL technical report
推荐:
- 使用 Instruct,不在 MVP 首先使用 Thinking;
- BF16 或经过独立精度检查的 8-bit 版本;
- Flash Attention;限制输入分辨率、图像数和输出长度;
- 生成阶段允许受控采样,验证阶段用接近确定性的 forced choice;
- 固定 HF revision/checkpoint hash,不使用浮动
main生成论文结果。
风险:17.5GB 只是权重体积,不包含激活、视觉 tokens、KV cache 和服务框架开销。它在 32GB 5090 上“很可能可运行”,但批量、多图和高分辨率是否稳定必须实测,不能在论文中把推测写成结果。
InternVL3.5 官方仓库列出 8B 版本总参数约 8.5B,并同时提供自定义格式和标准 Hugging Face 格式;标准 HF 模型卡为 Apache-2.0。建议优先用 -HF,减少自定义 remote code 对长期复现的影响。
它不只是“另一个强模型”,而是用于回答:
- selector 是否学习了通用的证据可靠性;
- 还是只学习 Qwen 的输出语气、置信数字或 token 分布;
- 只做少量 per-model calibration 是否能恢复迁移。
跨模型时禁止直接比较 raw logits/entropy。必须把 forced-choice margin、entropy 等在各模型 calibration split 内标准化,然后测试:
- Qwen 训练→InternVL 零样本;
- Qwen 训练→InternVL 只重标定;
- InternVL 完整重训。
用户原方案中的“MiniCPM-V 系列”需要冻结为明确版本。当前最合适的是 MiniCPM-V 4.6:官方说明它基于 SigLIP2-400M 与 Qwen3.5-0.8B,总规模约 1.3B,支持多图并提供 Transformers、vLLM、SGLang 和量化版本;官方模型卡为 Apache-2.0。
它是合理的效率基线,因为:
- 参数规模明显小于两个 8B 候选;
- 适合测试 selector 是否能从较弱但便宜的语义传感器中提取有用证据;
- 可以形成 queries、延迟、显存、能耗/成本与 safe coverage 的 Pareto 曲线。
但不能根据官方通用榜单断言它的接触能力足够。细粒度肢体、左右和遮挡恰好可能是小模型最先丢失的能力。
若预算允许,可使用带固定日期 snapshot 的强闭源视觉模型。以 OpenAI 为例,官方 Responses API 支持图像输入,支持的模型可用 json_schema Structured Outputs 强制结构;这解决的是格式有效性,不保证身体部位或接触判断正确。官方图像输入示例、Structured Outputs API 说明
必须记录:模型 snapshot、调用日期、system/user prompt、图像 detail、温度、seed(若接口支持)、重试、token 与美元成本。闭源模型不提供可比较的隐藏 logits 时,不把该特征留空后直接喂给同一个 selector;应使用共同可得的行为特征,或为闭源模型单独训练/校准。
保留,但输入从“红/蓝框图”改为 identity packet:
- 原始全图;
- 细轮廓/边框标记的全图,标签放在人物框外侧,避免遮住接触位置;
- 两人联合 crop;
- 可选的 contact-site crop,必须同时包含两个端点;
- person mask/track ID 作为 A/B 的真实身份锚点,禁止用“左边的人/右边的人”。
不要把单人 crop 用于判定两人是否接触,因为它移除了另一端证据;单人 crop 只可用于肢体定位、可见性和 laterality 辅助。
新增 marker-bias 消融:红/蓝对调、改用黄/青、只用 A/B 字母而不用颜色。若输出随颜色变化,说明所谓 person-swap inconsistency 可能只是视觉标记偏差。
保留冻结的 75-region ontology,但使用 canonical IDs,不让 VLM自由造词。建议把“是否为候选”和“接触状态”分开:
{
"schema_version": "contact_sensor_v1",
"person_map": {"A": "instance_007", "B": "instance_012"},
"edges": [
{
"a_region_id": "A_L_HAND_03",
"b_region_id": "B_R_FOREARM_02",
"state": "contact",
"visibility_a": "visible",
"visibility_b": "partial",
"evidence_mode": "visible_boundary_meeting",
"self_reported_confidence": 0.72
}
]
}state 推荐为 contact | near_contact | separated | indeterminate。在任一端不可见时,除非有强反证,不应轻易输出 separated/no_contact;允许空 edge 集合。
MVP 的 top-K=3 合理,但完整实验必须测 K=1/3/5 的 candidate recall ceiling。否则 selector 的上限可能被候选阶段锁死。
保留 forced-choice verifier,但必须防确认偏差。不能只验证 proposer 自己提出的边;验证集还要含:
- geometry-nearest candidates;
- GT positive(仅 oracle/audit);
- left/right swap;
- A/B swap;
- 邻近但错误的 body-region substitution;
- 明显错误和困难 near-contact negatives。
推荐输出:
{
"edge_id": "evt42_e07",
"decision": "supported",
"evidence_mode": "visible_boundary_meeting",
"self_reported_confidence": 0.76
}decision 为 supported | contradicted | indeterminate。验证提示中的候选顺序、A/B 叙述顺序和选项字母要随机化并记录,以检查 acquiescence/position bias。
对于开放模型,优先让答案为固定单 token 代码(如 A/B/C),从生成 scores 计算 option margin,再映射回语义标签。多词答案的 tokenization 不同,跨模型 raw logprob 不可直接比较。
MVP 使用 5 次生成采样是成本与统计性的合理折中,但必须固定:
temperature/top_p;- 5 个明确 seed;
- prompt version;
- image packet hash;
- model revision;
- JSON parser/retry 行为。
可提取频率、离散熵、左右变更次数、identity 变更次数、contact↔indeterminate 转换次数。它们是证据特征,不是概率,也不是 utility 标签。
ProsePose 已证明多采样有用,因此“我们也采样 5 次”属于必要 baseline,不是方法贡献。
保留四类 probe,但必须定义变换群和标签映射:
- Paraphrase: 预先冻结 3 个等义模板,不在测试后挑最稳定模板;
- Horizontal flip: 保留 instance A/B,使用预注册映射
tau_flip交换所有 left/right ontology IDs; - Person swap: 交换 A/B 标签或颜色,接触边端点随之交换;比较前把无向接触边 canonicalize;
- Crop: 比较 raw full、marked full、joint-person crop、双端 contact-site crop。单人 crop 不参与接触存在性一致性。
一致性必须和正确性、utility 分开报告。空间 VLM 具有系统性 left/right 弱点,What's Up和 LRR-Bench均提供直接证据;更关键的是,Consistent Yet Wrong / ViewDiag显示跨视图稳定可能来自先验塌缩,而非视觉证据敏感性。因此:
consistency 高不能自动 use;consistency 低也不自动 abstain。它只能与真实 downstream outcome 建立经验关系后进入 selector。
推荐的预干预 VLM 特征:
- proposal frequency / normalized entropy;
- verifier decision 与 option margin;
- self-reported confidence(只作弱 baseline);
- paraphrase/flip/person-swap/crop consistency;
- left-right confusion count;
- identity inconsistency count;
- visibility state;
- contradiction count;
- JSON invalid/retry count;
- query budget、模型 ID 和 probe mask。
推荐的预干预几何特征:
- initial region-to-region minimum/robust distance;
- initial penetration depth/volume;
- initial 2D reprojection error;
- candidate contact-gradient norm;
- contact gradient 与基础 objective gradient 的 cosine;
- relative-depth uncertainty;
- occlusion ratio;
- initializer confidence/visibility;
- one-step linearized improvement estimate(若严格限定为加入约束前计算)。
禁止作为 selector 输入的 outcome leakage:
- 完整优化后的 penetration change;
- 加边后的最终 reprojection/contact/pose error;
- optimizer convergence/success flag;
- GT contact 或 GT mesh 派生量;
- oracle best edge/weight;
- 任何由同一 paired outcome 直接计算的统计量。
用户原列表中的 penetration change 必须从特征移到标签/评价;可以保留的是 initial penetration 或预先定义的一步线性化预测。
对事件 x、候选边 e 和优化上下文 c(initializer、loss、权重、迭代预算)定义两次配对运行:
O0 = Optimize(x, c, no_edge);O1 = Optimize(x, c, add_edge=e)。
所有非接触项、初始化、随机性和预算保持一致。定义 outcome 差:
Delta_contact = metric_contact(O0) - metric_contact(O1)
Delta_pair = metric_pair(O0) - metric_pair(O1)
Delta_pose = metric_pose(O0) - metric_pose(O1)
Delta_pen = metric_pen(O0) - metric_pen(O1)
正值表示改善。三类标签由预注册门槛产生:
- helpful: 主 interaction/contact 指标改善,且 pose、reprojection、penetration 等安全项均不越过非劣界;
- harmful: 任一主要安全项明显恶化,或综合 utility 低于 harm margin;
- neutral: outcome 差落在优化噪声/等价区间内。
先重复运行 no-edge 与一部分 edge,估计 optimizer 本身的方差,再冻结 neutral band。否则微小数值噪声会被错误当成监督标签。
- 100 个不重叠 interaction events;同一事件的相机、帧和 subject pair 不跨 split;
- 20 events 用于 prompt/schema/debug,不进入选型数字;
- 80 events 作为 locked pilot;
- 分层覆盖:明确接触、near/no-contact、重遮挡、小接触区域、laterality 困难和 person overlap;
- 最终论文 test events 与这 100 个事件隔离。
- 三个模型接收完全相同的 identity packet、ontology、prompt 语义和 query budget;
- 候选生成阶段分别比较 recall@K/precision@K;
- 验证阶段使用所有生成器和 geometry union 后的同一 fixed candidate bank;
- 每个模型独立 calibration,不直接比较 raw confidence/logit 数值;
- 全部输出缓存并以
event/model/revision/prompt/transform/seed唯一寻址。
传感器准确性: edge precision/recall/F1、body-region accuracy、laterality error、A/B swap error。
格式与稳定性: JSON validity、empty rate、retry rate、paraphrase/flip/swap/crop consistency。
效用判别: utility AUPRC/AUROC、Spearman、geometry→geometry+VLM 的增量、matched-coverage HarmRate、AURC。
效率: 每图/每 edge 延迟、峰值显存、输入/输出 tokens、每事件总 query 数、闭源成本。
主要指标不是 contact F1,而是:
在固定 candidate bank 上,加入该 VLM 的证据后,相比 geometry-only 能否稳定改善 harmful/helpful discrimination 和 matched-coverage downstream risk。
推荐采用 one-standard-error rule:若多个模型的主 utility 指标差异在一个标准误内,选择更快、显存更低、JSON 更稳定的模型。这样 MiniCPM-V 即使不是 contact F1 第一,也可能成为更好的部署传感器。
- VLM selection Go: 至少一个模型的
geometry+VLM相对geometry-only在 locked pilot 上主指标方向一致,cluster bootstrap CI 不支持“完全无增量”,且 safe coverage 不是靠几乎全 abstain 得到; - Qwen 主模型 Go: Qwen 位于最佳 utility 组,或按 one-standard-error rule 以效率/稳定性胜出;
- No-Go: 所有模型只有 contact F1 提升而没有 fixed-candidate utility 增量。此时保留 geometry selector,把 VLM 方向降级为负结果/benchmark,不训练更复杂 VLM 模块。
- A/B 彩框或 Set-of-Marks;
- 75-region ontology;
- JSON schema;
- generate-then-verify;
- 5/20 次采样;
- self-reported confidence;
- prompt paraphrase、flip 或 swap augmentation;
- 直接把 confidence 变成 contact loss weight;
- 让更大 VLM 替换较小 VLM。
不是改 VLM backbone,而是建立一个可替换传感器接口,把 VLM 的生成、验证和 perturbation evidence 与实际 optimizer intervention outcome 对齐。创新实体是:
- 条件 edge utility 数据与标签协议;
- fixed-candidate residual-value 识别;
- selective use/abstain 与 no-harm evaluation。
这最符合 TrustContact,也最能与 ProsePose/APU/REACT 区分。
把 person permutation S2 与 horizontal reflection C2 定义为明确的 contact-edge 变换,测量模型是否遵循预期映射;但贡献必须是:
这种残差等变误差能否在控制 geometry、sampling entropy 和 candidate identity 后,额外预测 downstream harm。
单纯报告 flip accuracy 不足。还要用 ViewDiag 式反例证明模型不会只是“稳定地答错”。
可把初始双人 SMPL-X 按候选边高亮,从少量标准视角渲染,询问 VLM“该 3D 假设与原图是否一致”。它可能比只看 RGB 更接近实际 intervention。
风险很高:InteractVLM 已有 Render–Localize–Lift;ContactPrompt 已用 mesh visual prompts;LayoutVLM 使用 marked images;VLM-Guided GPA 已让 VLM critique mesh hypotheses。因此新颖性必须限定为“candidate-edge counterfactual + outcome calibration”,不能声明首次让 VLM 看 3D 渲染。
建议放 Full/Stretch,不进入首轮 MVP。
先运行一次 proposer 和一次 verifier;只有 selector epistemic uncertainty 高时,才追加 flip/swap/paraphrase/crop probes。评价 safe coverage 与 query cost 的 Pareto 前沿。
它能显著降低 5×采样和多变换成本,但属于效率支持贡献,不能取代核心 outcome utility。
定义模型无关的 evidence schema,并用 per-model calibration 将 entropy、margin、invalid rate 等映射到统一尺度。若 Qwen 训练的 selector 只重标定即可迁移到 InternVL/MiniCPM,这会成为很强的泛化结果;若完全不能迁移,也能形成“证据可靠性是 model-specific”的有价值边界结论。
每个事件:
- 原图 + marked full + joint crop,Qwen proposer 采样 5 次;
- 合并、canonicalize 后最多保留 3 条 VLM 候选;
- 对 fixed candidate bank 中每条边进行一次接近确定性的 forced-choice verification;
- 首轮只追加 3 个固定 paraphrases、1 次 flip、1 次 person swap;
- crop consistency 仅使用 full/joint/contact-site 三类包含双端的视图;
- 全部 JSON、token scores、图像 hashes 和解析状态离线缓存;
- VLM 完全冻结,不参与反向传播;
- selector 先用 logistic regression,再用两层 MLP;复杂模型只有超过简单模型才保留。
为了控制成本,可把变换 probe 限制在 top-3 candidates,而不是对 75×75 所有边查询。
| ID | 实验 | 回答的问题 | 关键控制 |
|---|---|---|---|
| VLM-S00 | 三模型 100-event audit | 哪个 VLM 最有 downstream utility evidence | fixed candidates、同 query budget |
| VLM-S01 | Raw vs marked vs joint/contact-site crop | 标记和裁剪是否改善 grounding,还是引入颜色偏差 | 同图同 prompt |
| VLM-S02 | proposer-only vs proposer+verifier | verifier 是否有真增量 | 含 proposer positives、随机/对抗 negatives |
| VLM-S03 | N=1/3/5/10 sampling | 采样收益与成本何时饱和 | 相同模型和 candidate K |
| VLM-S04 | paraphrase/flip/swap/crop feature ablation | 哪类一致性预测 harm | fixed edge、geometry controls |
| VLM-S05 | consistency→contact truth vs consistency→utility | 一致性到底预测什么 | 同一事件 cluster statistics |
| VLM-S06 | self-confidence vs token margin vs calibrated evidence | 自报 confidence 是否可用 | validation-only calibration |
| VLM-S07 | Qwen→InternVL/MiniCPM transfer | selector 是通用还是 model-specific | raw/standardized/recalibrated 三种特征 |
| VLM-S08 | balanced verification negatives | 是否存在确认偏差 | 正负/困难负例、选项顺序随机化 |
| VLM-S09 | query budget cascade | 能否以更少查询保持 safe coverage | 相同 HarmRate target |
| VLM-S10 | 3D highlighted-render counterfactual | 3D 提示是否带来 RGB 之外增量 | 同 candidate、同 selector、同总 tokens |
| 风险 | 等级 | 原因 | 修复 |
|---|---|---|---|
| 被评为 ProsePose/APU + classifier | Major | 方法表面结构非常接近 | 以 outcome dataset、fixed-candidate identification、HarmRate/AURC 为论文主轴 |
| generate-then-verify 被 REACT 覆盖 | Major | 任务虽不同,机制已出现 | 不把 verifier 当贡献;强调 optimizer utility 和 single-image reconstruction |
| consistency 高但错误 | Major | 已有直接空间 VLM 证据 | 一致性只作 feature;必须与 truth/utility 双重标定 |
| outcome leakage | Critical if present | penetration change 等会直接泄露标签 | 只允许 pre-intervention features;自动 schema audit |
| Qwen 不是任务最佳模型 | Medium | 通用榜单不代表接触效用 | 100-event model selection;主模型由规则选出 |
| 标记/颜色遮挡接触 | Medium | 视觉 prompt 可能改变证据 | 原图与细轮廓同时输入;marker-bias ablation |
| cross-VLM feature 不可比 | Medium | logits、entropy、语气尺度不同 | per-model standardization 与 calibration |
| 75-region 太粗 | Medium | 手指/小面积接触无法区分 | 首篇保持标准 ontology;dense hand 只作局限/Stretch |
- VLM 作为冻结语义传感器的定位成立;
- Qwen3-VL-8B-Instruct 是合理的首个部署对象,但还不是已证实的最终主模型;
- MiniCPM-V 效率基线应明确为 1.3B 的 4.6;
- generate/verify、结构化推理和多采样已被近邻覆盖;
- outcome-supervised utility 与 fixed-candidate no-harm evaluation 仍是当前最可信的差异。
证据来自 ProsePose、APU、GECO、InteractVLM、ContactPrompt、SocialMirror、VLM-Guided GPA、REACT,以及空间一致性/校准文献;模型版本、许可和部署路径来自各官方仓库与模型卡。
Gate 2 仍然未通过。Gate-A2 已证明 safety-aware optimizer 下仍保留 aggregate oracle contact headroom;当前剩余原因是尚未证明:
- VLM evidence 在固定候选边下超过 geometry-only;
- use/abstain 在非零 coverage 下确实降低 HarmRate。
2026-08-25 更新:原 Gate-A 已证明 contact headroom,但 full gate 因 penetration safety 失败;O1 冻结标签为 21 helpful / 6 neutral / 23 harmful。该结果只证明 selective-decision problem 存在,不证明 VLM 能预测 utility。
- 取得 CHI3D 原始图像,并冻结不与 Gate-A/A2 cohort 混用的 VLM audit pool;
- 完成 PromptHMR/Multi-HMR baseline gate;
- 在服务器冻结三个开放 VLM 的 revision 和推理环境;
- 建立 20-event prompt debug + locked audit,再运行 VLM-S00;
- 在任何完整 selector 训练前完成 leakage audit;
- 每月检查 REACT 的正式论文/代码,以及 ContactPrompt、SocialMirror、InterMesh 的代码发布状态。
Qwen3-VL-8B-Instruct 的首个冻结 smoke 已完成,结论是 不能进入 locked
model selection。v1 和 v2 的负样本预检暴露示例复制与无接触幻觉;版本化
修复后的 v3 在 20 张 Hi4D DEBUG20、每图 5 次采样上实现 100% JSON validity、
100% A/B compliance 和零 edge-cap violation,但冻结 contact-only gate 的
balanced accuracy 为 0.444、coarse-edge precision 为 0,且 laterality 无样本
可评估,最终 gate_pass=false。
失败后、明确不参与 Gate 判定的候选诊断显示:若把 near_contact 也视为
proposer candidate,事件级 balanced accuracy 为 0.899,但 coarse-edge precision
仅 0.10。这一分离很关键:Qwen 可能识别“这两个人附近存在交互/接触风险”,
却不能可靠定位具体 A/B 身体部位。因此当前数据支持 VLM 是 high-recall noisy
candidate sensor 的有限假设,不支持它是可直接施加 loss 的 contact oracle。
接下来只允许在同一 DEBUG20 上做平衡 fixed-edge verification:候选集合必须同时 包含 GT-positive、proposer-positive、geometry near-contact 和左右/A-B/远距离 counterfactual negatives;verifier 用近确定性解码,并报告 TPR、TNR、region precision、option-order bias 和 abstention。只有它在预先冻结门槛下修复细粒度 grounding,才有资格运行 LOCKED80 或构造 selector utility 数据。
上述 fixed-edge repair 已执行完毕并关闭,不能再写成“待验证的推荐方案”。
- 直接逐边 decision 不可靠。 同一真边和假边,support-first prompt 都给
supported,falsification-first prompt 都给contradicted。定位 overlay 没有改变该结果,说明 prompt polarity 大于图像证据。 - 把 decision 移出 VLM 是必要但不充分的。 中性 evidence schema 消除了 大部分直接极性冲突,但固定规则的 coverage 降为 0;模型倾向把所有关系写成 depth ambiguity,或在措辞变化下同时给出 ambiguity/gap。
- joint marker 不是足够的 body-surface grounding。 PromptHMR 的 OpenPose BODY-25 关节必须按正确 convention 使用;即便修正,关节圆点和骨架粗管也不 表示真实 contact surface。
- predicted mesh-surface render 仍未救回 verifier。 使用 SMPL-X→SMPL sparse transfer、coarse segmentation 和联合 z-buffer 得到可见 surface,保持 prompt、 candidates 与 rule 不变后,dev coverage 仍为 0;无 visible surface 时模型还会 在两份 prompt 中分别报告 meeting 与 gap。
- 3D contact truth 与单图证据必须分开。 新建的 Camera04 visibility proxy 证明当前四条正边具有较高的 z-buffer endpoint visibility,但 neutral-SMPL 重投影和 silhouette 仍有误差,因此只能用于 difficulty stratification,不能 当官方可见性标签。
因此,当前最稳妥的 VLM 定位进一步收缩为:冻结的高噪声候选/语义证据源,
不能充当最终 verifier。 reported_confidence、sampling agreement、paraphrase
consistency、joint/surface response 都只允许作为 selector feature;它们必须在
真实 optimizer outcome 上证明相对 geometry-only 的增量。下一实验不再是换
prompt 或换 VLM,而是 Gate-B paired intervention dataset。跨 VLM 只在该增量
成立后恢复。
已从安全通过的 Gate-A2 optimizer context 中导出 18 个真实 top-1 contact interventions,并沿用冻结 utility margins 得到 8 helpful / 2 neutral / 8 harmful。 无泄漏 geometry-only logistic 在 leave-one-interaction-family-out 下达到 harmful AP 0.714、ROC-AUC 0.688;25% coverage 的 4 个低风险事件中 HarmRate 为 0。 这个结果说明 outcome 标签和 geometry control 的管线可以工作,但 cohort 已被 用于 Gate-A2 safety confirmation,因此只允许写成开发性结果,且对简单 contact-loss baseline 的 bootstrap 增量仍不稳定。
现有 Qwen evidence 不能被加入上述模型:它来自 Hi4D,而 utility labels 来自
CHI3D,事件交集为 0。TrustContact 的核心比较必须是同一 image、同一 A/B、同一
candidate edge 和同一 optimizer context 下的 geometry 与 geometry+VLM。
下一步不是训练 selector,而是在 Hi4D 上打通 2-event/4-edge optimizer smoke,
冻结 coarse semantic region 到 75 SMPL-X patch 的映射后再生成对齐 labels。
上述 2-event/4-edge smoke 与 full intervention 已完成。coarse semantic region 通过 sparse SMPL-X→SMPL transfer 的几何质量映射到 r75;smoke 的 8 个 O0/O1 cells 全部通过初始化、边数、gradient、重复性与数值有限性审计。随后同四条候选 以冻结的 1000×2 HHCS optimizer 运行,得到 1 helpful / 2 neutral / 1 harmful。
最重要的机制观察不是平均提升,而是四种语义—效用组合同时出现:GT-positive 候选既可能 helpful,也可能 neutral;counterfactual 候选既可能 neutral,也可能 harmful。最严重的 false edge 使真实 contact correspondence 变差 47.34 mm, relative pelvis error 变差 96.42 mm。这支持 TrustContact 的任务定义:selector 必须预测“加入此边后的 outcome”,不能只预测“该边语义上是否接触”。
V0d/V0e 的离线 Qwen evidence 已按 candidate/event/image/edge 精确 join,但固定 规则对 4/4 候选均 abstain,coverage=0。prompt disagreement 在此小样本中覆盖唯一 harmful,但也覆盖一个 neutral,而且二者属于同一 event。因此当前结论严格为:
- aligned VLM residual 管线已打通;
- 当前 fixed verifier 没有 useful coverage;
- n=4、2 events 不允许训练或评价 selector;
gate_b_semantic_residual_pass=false,LOCKED80 与跨模型实验继续冻结。
后续扩大 development cohort 时,必须按 event 分组,先冻结 geometry-only,再在 完全相同 candidates/outcomes 上加入缓存的 sampling、agreement、surface relation 和 confidence features。只有 held-out event 上出现增量,VLM 才能恢复为论文主张。