TrustContact 面向单张 RGB 图像中的双人近距离交互重建,研究视觉语言模型提出的接触约束在什么条件下应被双人 SMPL-X 优化器使用或拒绝。项目不把 VLM 的语义置信度直接视为优化可信度,而是通过同初始化、同预算的 O0 无接触优化与 O1 单边接触干预,测量每条候选边的条件下游效用。
项目当前最稳健的成果是 Contact Intervention Utility(CIU)问题定义、配对干预标签、多维安全评价、数据隔离与 fail-closed 审计体系。开发集上的几何风险过滤器显示出明显信号,但冻结的小规模独立验证未达到 helpful retention 门槛,因此当前不能宣称已经获得验证成功的最终 selector。
系统由五个主要环节组成:
- 冻结的 PromptHMR 或 Multi-HMR 生成双人 camera-space SMPL-X 初始化;
- Qwen3-VL 与几何规则生成冻结候选接触边;
- ProsePose HHCS 在同一初始化上运行 O0/O1 配对优化;
- 系统根据接触收益和七维安全差值生成 helpful、neutral、harmful 标签;
- 轻量风险模型根据干预前特征决定 use 或 abstain。
当前标签规则以 GT-edge distance 为主要接触指标。改善超过 5 mm 且全部安全指标保持在非劣边界内时,候选边为 helpful;接触距离恶化超过 5 mm、优化失败或任一安全指标越界时为 harmful;其余为 neutral。
安全评价包括 MPJPE、PA-MPJPE、translation-aligned PVE、relative translation error、penetration maximum、penetration mean 和 reprojection error。标签实现见 src/trustcontact/utility.py,冻结门槛见 configs/gate_a_oracle.yaml。
50-event Gate-A 表明接触约束存在明显 headroom,但无条件接触增加了人体穿透,因此原 Gate-A 保持失败。加入审计过的安全损失后,Gate-A2 在未触碰的 18-event reserve 上通过聚合非劣检验,但事件标签仍为 8 helpful、2 neutral、8 harmful,说明逐事件选择问题仍然存在。
| 实验 | GT-edge distance | Penetration max | 结论 |
|---|---|---|---|
| Gate-A O2-O0,50 events | -93.23 mm | +13.24 mm | 接触收益通过,安全失败 |
| Gate-A2 O1-O0,reserve 18 | -80.86 mm | -0.66 mm | 当前优化上下文通过 |
Qwen3-VL-8B-Instruct 在 DEBUG20 上完成 100 次采样。输出格式和身份一致性检查通过,但 contact-only majority balanced accuracy 为 0.444,粗边 precision 为 0,因此严格 Gate 失败。后续固定边验证、相反提示词、关节 overlay 和 predicted-surface grounding 也未通过。当前 Qwen 只保留为高噪声候选生成器,而不是 contact verifier。
BR1 完成 K={1,5,20,100,1000} 共 240 个优化单元。K100 对 K1000 的局部收益 Spearman 为 0.831、全局收益 Spearman 为 0.745,运行成本为 0.242 倍;但安全违规召回只有 4/7,漏掉三条晚期穿透风险。该结果支持“短响应可以预测收益排序”,不支持“短响应已经解决安全筛选”。
CIU-F3 完成 32 个事件、124 条候选和 156 个 K1000 优化单元,全部结果具有完整连续目标和七维安全向量。
| 候选类型 | 数量 | Helpful | Neutral | Harmful |
|---|---|---|---|---|
| GT-positive | 32 | 15 | 10 | 7 |
| Nearest hard-negative | 32 | 14 | 9 | 9 |
| Distance-matched negative | 32 | 11 | 6 | 15 |
| Natural Qwen proposal | 28 | 3 | 5 | 20 |
| 合计 | 124 | 43 | 30 | 51 |
自然 Qwen 提案在无条件使用时有 20/28 harmful,HarmRate 为 71.4%。这说明语义提案不能直接进入优化器,也说明 GT-positive、negative 和下游效用之间不存在简单的一一对应。
开发集 five-fold event-grouped OOF 风险过滤在 25% coverage 下接受 7 条 Qwen 提案,其中 2 helpful、4 neutral、1 harmful,HarmRate 为 14.3%,helpful retention 为 66.7%。这一结果只属于开发信号,因为接受集很小且 cluster-bootstrap 区间包含零。
CIU-VAL 使用 14 个 sequence-disjoint events,得到 11 条可执行 Qwen 提案和 3 次显式 abstention。11 条提案包含 4 helpful、1 neutral、6 harmful;always-use HarmRate 为 54.5%。冻结过滤器接受 2 条,结果为 1 helpful、1 neutral、0 harmful,但 helpful retention 只有 25%,低于冻结的 40% 门槛,因此正式结论为 fail_small_heldout_confirmation。
事后 harmful-risk AUC 和 top-3 诊断只能用于设计下一轮协议,不能覆盖本次严格失败。TEST-ID 和 ACTION-OOD 尚未访问。
项目包含 src/trustcontact 核心包、实验配置、数据与候选冻结脚本、HMR/VLM 推理入口、配对优化器、评价器、审计器和单元测试。运行过程广泛使用 manifest、SHA-256、图像尺寸与字节数检查,任何输入漂移、结果缺失或候选不一致都会 fail closed。
公开仓库不包含 Hi4D/CHI3D 原始图像、SMPL/SMPL-X 模型、VLM/HMR 权重、Conda 环境、第三方仓库或带授权人物画面的 overlay。公开结果只保留不含原始人物图像的统计曲线、CSV 表格和审计 JSON。
项目已经证明 VLM 接触语义与优化效用不能等同,并建立了可审计的 CIU 评价流程。当前正向方法“VLM proposer + geometry outcome-risk filter”在 DEV 上有希望,在小规模 VAL 上表现出安全排序信号,但没有通过预注册的 helpful-retention 门槛。下一阶段应先冻结新的可部署 operating point,再进行新的独立确认,并逐步补齐跨 initializer、跨 optimizer 和跨数据集验证。
- 当前 CIU 主结果来自 Hi4D Camera04;
- 主执行上下文集中于 PromptHMR GT-box interaction-off 与 ProsePose HHCS;
- CHI3D raw images 缺失,fresh CHI3D 对照仍受阻;
- VLM fixed-edge grounding 未通过冻结 Gate;
- selector 的独立正向证据不足;
- TrustContact 源码尚未指定开源许可证。
更完整的阶段记录见 research/research_log.md,实验登记表见 research/tables/experiment_registry.csv。


