Skip to content

Latest commit

 

History

History
94 lines (56 loc) · 6.58 KB

File metadata and controls

94 lines (56 loc) · 6.58 KB

TrustContact 中文项目报告

项目概述

TrustContact 面向单张 RGB 图像中的双人近距离交互重建,研究视觉语言模型提出的接触约束在什么条件下应被双人 SMPL-X 优化器使用或拒绝。项目不把 VLM 的语义置信度直接视为优化可信度,而是通过同初始化、同预算的 O0 无接触优化与 O1 单边接触干预,测量每条候选边的条件下游效用。

项目当前最稳健的成果是 Contact Intervention Utility(CIU)问题定义、配对干预标签、多维安全评价、数据隔离与 fail-closed 审计体系。开发集上的几何风险过滤器显示出明显信号,但冻结的小规模独立验证未达到 helpful retention 门槛,因此当前不能宣称已经获得验证成功的最终 selector。

技术架构

TrustContact 技术架构

系统由五个主要环节组成:

  1. 冻结的 PromptHMR 或 Multi-HMR 生成双人 camera-space SMPL-X 初始化;
  2. Qwen3-VL 与几何规则生成冻结候选接触边;
  3. ProsePose HHCS 在同一初始化上运行 O0/O1 配对优化;
  4. 系统根据接触收益和七维安全差值生成 helpful、neutral、harmful 标签;
  5. 轻量风险模型根据干预前特征决定 use 或 abstain。

效用定义

当前标签规则以 GT-edge distance 为主要接触指标。改善超过 5 mm 且全部安全指标保持在非劣边界内时,候选边为 helpful;接触距离恶化超过 5 mm、优化失败或任一安全指标越界时为 harmful;其余为 neutral。

安全评价包括 MPJPE、PA-MPJPE、translation-aligned PVE、relative translation error、penetration maximum、penetration mean 和 reprojection error。标签实现见 src/trustcontact/utility.py,冻结门槛见 configs/gate_a_oracle.yaml。

关键实验

Gate-A 与 Gate-A2

50-event Gate-A 表明接触约束存在明显 headroom,但无条件接触增加了人体穿透,因此原 Gate-A 保持失败。加入审计过的安全损失后,Gate-A2 在未触碰的 18-event reserve 上通过聚合非劣检验,但事件标签仍为 8 helpful、2 neutral、8 harmful,说明逐事件选择问题仍然存在。

实验 GT-edge distance Penetration max 结论
Gate-A O2-O0,50 events -93.23 mm +13.24 mm 接触收益通过,安全失败
Gate-A2 O1-O0,reserve 18 -80.86 mm -0.66 mm 当前优化上下文通过

Gate-V0

Qwen3-VL-8B-Instruct 在 DEBUG20 上完成 100 次采样。输出格式和身份一致性检查通过,但 contact-only majority balanced accuracy 为 0.444,粗边 precision 为 0,因此严格 Gate 失败。后续固定边验证、相反提示词、关节 overlay 和 predicted-surface grounding 也未通过。当前 Qwen 只保留为高噪声候选生成器,而不是 contact verifier。

BR1 短响应探针

BR1 完成 K={1,5,20,100,1000} 共 240 个优化单元。K100 对 K1000 的局部收益 Spearman 为 0.831、全局收益 Spearman 为 0.745,运行成本为 0.242 倍;但安全违规召回只有 4/7,漏掉三条晚期穿透风险。该结果支持“短响应可以预测收益排序”,不支持“短响应已经解决安全筛选”。

CIU-DEV

CIU-F3 完成 32 个事件、124 条候选和 156 个 K1000 优化单元,全部结果具有完整连续目标和七维安全向量。

候选类型 数量 Helpful Neutral Harmful
GT-positive 32 15 10 7
Nearest hard-negative 32 14 9 9
Distance-matched negative 32 11 6 15
Natural Qwen proposal 28 3 5 20
合计 124 43 30 51

自然 Qwen 提案在无条件使用时有 20/28 harmful,HarmRate 为 71.4%。这说明语义提案不能直接进入优化器,也说明 GT-positive、negative 和下游效用之间不存在简单的一一对应。

开发集 five-fold event-grouped OOF 风险过滤在 25% coverage 下接受 7 条 Qwen 提案,其中 2 helpful、4 neutral、1 harmful,HarmRate 为 14.3%,helpful retention 为 66.7%。这一结果只属于开发信号,因为接受集很小且 cluster-bootstrap 区间包含零。

CIU-DEV Qwen 提案过滤曲线

CIU-DEV Coverage–Safety 曲线

CIU-VAL 冻结确认

CIU-VAL 使用 14 个 sequence-disjoint events,得到 11 条可执行 Qwen 提案和 3 次显式 abstention。11 条提案包含 4 helpful、1 neutral、6 harmful;always-use HarmRate 为 54.5%。冻结过滤器接受 2 条,结果为 1 helpful、1 neutral、0 harmful,但 helpful retention 只有 25%,低于冻结的 40% 门槛,因此正式结论为 fail_small_heldout_confirmation。

CIU-VAL 冻结确认

事后 harmful-risk AUC 和 top-3 诊断只能用于设计下一轮协议,不能覆盖本次严格失败。TEST-ID 和 ACTION-OOD 尚未访问。

工程与复现

项目包含 src/trustcontact 核心包、实验配置、数据与候选冻结脚本、HMR/VLM 推理入口、配对优化器、评价器、审计器和单元测试。运行过程广泛使用 manifest、SHA-256、图像尺寸与字节数检查,任何输入漂移、结果缺失或候选不一致都会 fail closed。

公开仓库不包含 Hi4D/CHI3D 原始图像、SMPL/SMPL-X 模型、VLM/HMR 权重、Conda 环境、第三方仓库或带授权人物画面的 overlay。公开结果只保留不含原始人物图像的统计曲线、CSV 表格和审计 JSON。

当前结论

项目已经证明 VLM 接触语义与优化效用不能等同,并建立了可审计的 CIU 评价流程。当前正向方法“VLM proposer + geometry outcome-risk filter”在 DEV 上有希望,在小规模 VAL 上表现出安全排序信号,但没有通过预注册的 helpful-retention 门槛。下一阶段应先冻结新的可部署 operating point,再进行新的独立确认,并逐步补齐跨 initializer、跨 optimizer 和跨数据集验证。

主要限制

  • 当前 CIU 主结果来自 Hi4D Camera04;
  • 主执行上下文集中于 PromptHMR GT-box interaction-off 与 ProsePose HHCS;
  • CHI3D raw images 缺失,fresh CHI3D 对照仍受阻;
  • VLM fixed-edge grounding 未通过冻结 Gate;
  • selector 的独立正向证据不足;
  • TrustContact 源码尚未指定开源许可证。

更完整的阶段记录见 research/research_log.md,实验登记表见 research/tables/experiment_registry.csv。