懂接触、会预判,视触世界模型来了

懂接触、会预判,视触世界模型来了

机器人前瞻(公众号:robot_pro)

作者 | 周加琦

编辑 | 漠影

机器人前瞻9月20日报道,近日,Xspark AI(无界智航)联合香港科技大学(广州)、北京大学、香港大学、清华大学共同发布视触世界模型DexTouch-WM

DexTouch-WM是一种以动作序列作为输入约束的视触世界模型,面向灵巧手部交互,可同步预测未来视频画面以及双手全覆盖的精细触觉信息。

此外,该模型还采集了100h的人类双手交互数据集,包含50项日常双手操作的任务。

在评测中,该团队固定5h真机数据,人类双手交互数据从0分别增加至10h、50h、100h进行测试。结果显示,触觉接触相关指标提升尤为显著,Contact-F1最高达到0.706

一、视触融合,补上灵巧操作中的关键信息

手部灵巧操作包含大量物理接触细节,单凭视觉信息无法完整捕捉这类信息。有些动作看着几乎一模一样,但手部和物体间的接触压力、物体滑动或轻微卡滞的情况不同。当手掌遮住物体时,视觉上的信息缺失会更加严重。

现阶段视触融合类的世界模型,弥补了纯视觉模型无法建模接触力学、无法真实还原操作效果的缺陷。但现有方法同样存在局限,要么依赖高成本的真机数据,实现视觉与触觉的预测,要么只用人手触觉数据做预训练。

相比之下,DexTouch-WM则用低成本、大规模的人手交互数据,提升视触世界模型的效果。该模型整体由三大模块构成。

懂接触、会预判,视触世界模型来了

1、视觉预测支路

传统从零训练的视频预测网络容易出现画面失真、场景结构错乱等问题。DexTouch-WM采用冻结的预训练视频编解码网络处理,将首帧真实画面作为场景基准,通过加噪、去噪的方式迭代预测未来画面。

2、触觉预测支路

该模型采用解剖感知触觉分词器与分割式手部解码器,按照指尖、掌心的真实生理结构分区编码双手触觉热力图,还原真实手部接触状态。

3、多模态融合与动作约束

传统视触模型中视觉、触觉信息相互独立,无法理解动作与物理交互的关联。DexTouch-WM通过双模态联合注意力机制打通视觉、触觉分支,让画面信息与接触信息双向互补,根据手部运动推断接触压力变化,同时依靠触觉接触信息修正视觉预测偏差。

同时,该模型还将手部位姿、相机运动、语言指令作为约束条件,统一调控双模态生成。

此外,该模型在数据采集方面用的是穿戴式传感设备,人手穿戴手套与机器人灵巧手搭载完全一致的触觉传感布局,配合动作重映射算法,采集到的人类交互数据可直接迁移用于机器人模型训练。此方式把触觉采集从机器人本体上解耦,摆脱了对真机设备的依赖。

二、叠加人类操作数据时长,触觉预测指标显著提升

在模型预训练阶段,共采集约100h的第一人称双手交互数据,覆盖50项操作任务。评测中,该团队固定5h真机数据集不动,额外叠加10h、50h、100h的人类交互数据。

评测结果显示,Robot-only到叠加100h人类数据的DexTouch-WM,视觉PSNR 由23.473提升至27.096,轨迹精度由0.891升至0.962,几何误差由0.128降至0.100。

懂接触、会预判,视触世界模型来了

随着人类交互数据规模的提升,模型在视触觉领域的预测指标提升更加显著。叠加100h人类数据后,触觉PSNR由24.813提升至29.179,Contact-IoU由0.415升至0.588,Contact-F1由0.551升至0.706。可以看到,仅叠加10h人类数据,触觉预测指标提升微弱,性能提升主要集中在50h到100h区间

除基础视触预测能力外,该模型还能够评估和生成交互数据。

1、虚拟策略评估器

DexTouch-WM可搭建虚拟仿真环境,替代真机测试各种手部操作策略,降低真机反复测试的损耗与时间成本。

2、合成交互数据生成器

该模型能够批量生成符合真实接触力学规律的视触仿真轨迹,补充机器人策略训练数据集,减少真机采集触觉数据的工作量。

结语:给灵巧操作加上触觉预测

对于灵巧操作而言,视觉、动作与触觉并不是彼此独立的信息,而是共同决定交互能否完成。DexTouch-WM将三者结合,让世界模型不再局限于对场景变化的视觉预测,同时对双手触觉状态进行预测,进一步覆盖动作执行过程中的接触变化。

对于灵巧操作来说,能否准确描述复杂的接触过程,并将这种预测能力进一步用于策略训练和实际操作能力,是这类世界模型需要持续验证的方向。