考拉悠然双线告捷:技术登顶全球第一,战略合作再迎头部机器人厂商
考拉悠然双线告捷:技术登顶全球第一,战略合作再迎头部机器人厂商!
近日,三视角具身世界模型评测基准 TriWorldBench 榜单更新,考拉悠然联合同济大学研发的悠然无界多视角世界模型 BWM-Pro 以 70.42 分斩获总榜第一,同时包揽三视角一致性、任务对齐、运动质量三大维度第一。在全部 19 项细分指标中,BWM-Pro 取得 5 项第一、10 项前三。

图 1:BWM-Pro 总分 70.42 位列 TriWorldBench 总榜第一(共 55 个模型)

图 2:BWM-Pro 六大维度分数
与此同时,考拉悠然与头部机器人厂商签署战略合作协议。双方将围绕具身大脑研发及重点行业展开合作,推动具身智能从技术验证进一步走向真实场景与规模化应用。
一边是世界模型能力在全球评测中的持续验证,一边是“大脑+本体”产业协同进一步深化。考拉悠然正在从模型能力突破,加速走向具身智能真实世界应用。
01/
从单视角到多视角,世界模型迎来更全面的考验
现有世界模型评测多聚焦单视角视频,但真实机器人操作并不是单一视角下的视觉预测问题,而是需要头部与双腕相机共同感知全局任务、局部交互与物体状态变化。TriWorldBench 因此将三路同步视频纳入统一评测,基于 RoboTwin 2.0 设置 50 项双臂操作任务、500 个测试片段,并从六大维度、19 项指标综合考察多视角一致性、任务执行、物理规律与视觉生成能力。相比单视角生成,模型不仅要让每个画面逼真,还要保证三个视角中的物体状态、动作时序和任务进程严格一致,对世界模型的综合预测能力提出了更高要求,也吸引了众多海内外高校、科研机构和企业团队参与竞争。

图 3:TriWorldBench 三视角与六维评测框架
面向这一挑战,考拉悠然联合同济大学研发的悠然无界多视角世界模型 BWM-Pro。给定头部与双腕的初始画面及动作序列,模型即可同步推演三个视角下的未来变化,且不同视角中的机械臂动作、物体状态与交互时序保持一致。此次登顶 TriWorldBench,正是 BWM-Pro 在动作预测与跨视角协同能力上的集中体现。
02/
三大维度领跑,BWM-Pro 的优势在哪里?
三个视角,对得上
在三视角一致性维度,BWM-Pro 以 85.73 分位列第一。其中,Normalized PSNR、SSIM、VQA Consistency 三项指标夺冠,VLM Consistency II、VLM Consistency I 分别位列第二、第三。
机器人操作时,头部与腕部镜头的视野差异很大。模型需要把全局场景与局部动作联系起来。这组成绩,体现了 BWM-Pro 在跨视角预测上的优势。

图 4:三视角一致性维度指标
围绕任务,跟的准
在任务对齐维度,BWM-Pro 以 87.48 分位列第一,其中 Semantic Alignment 达到 92.24 分,排名第一;JEPA Similarity 达到 95.59 分,排名第二。
给定一项操作任务,未来画面需要呈现相应的动作和状态变化。任务语义与参考动态上的表现,是 BWM-Pro 本轮登顶的另一项支撑。

图 5:任务对齐维度指标
动作轨迹,预测更准确
在运动质量维度,BWM-Pro 以 49.87 分位列第一,其中 Trajectory Accuracy 以 62.41 分夺冠。
机械臂往哪里移动、沿着怎样的路径接近物体,都会影响后续操作。轨迹准确率取得第一,展现了 BWM-Pro 对运动变化的精确预测。

图 6:运动质量维度指标
此外,BWM-Pro 在视觉质量维度排名第三,Image Quality 与 Aesthetic Quality 两项指标均进入前三。面向抓取放置、物体堆叠、倾倒、双臂交接、开关操作与工具使用等多类任务,BWM-Pro 将腕部视角的接触细节与头部视角的全局变化协同起来,不论是简单还是复杂场景,都展现出兼顾精细动作控制与多视角一致性的预测能力。以下为部分任务演示:
03/
技术攻坚,BWM-Pro 凭什么实现突破?
从“生成三段视频”到“推演同一个世界”,关键在于让双臂动作、局部交互与全局场景遵循一致的演化过程。BWM-Pro 围绕具身结构、多尺度时序与跨视角空间关联三个层面展开架构设计,将动作的精细控制与场景的协同预测纳入统一框架,探索面向双臂操作的多视角世界建模。

图 8:BWM-Pro 技术架构图
创新一|具身结构先验,重构动作与视觉的控制关系
BWM-Pro 将机械臂与摄像机的物理对应关系转化为模型内部的控制结构:头部视角接收双臂动作轨迹,左右腕部视角仅直接接收同侧轨迹。这一设计不再将完整动作无差别地广播至所有视角,而是在动作编码前明确控制归属。让机器人本体结构参与预测,从源头限制无关动作的直接注入,为双臂操作建立分工明确的动作—视觉映射。
创新二|多尺度动作驱动,贯通精细交互与连续演化
BWM-Pro 围绕动作序列与视频演化的时间结构,构建粗细协同的双路径控制机制:细粒度分支通过交叉注意力读取完整轨迹,保留逐时刻动作信息;粗粒度分支将成组动作与视频潜在时间步对齐,通过自适应调制引导连续运动变化。两条路径共享具身路由,让精细动作信息与成组时序信息共同参与生成,将局部交互与连续演化纳入统一建模。
创新三|几何感知协同,推动多视角世界的一致推演
BWM-Pro 在共享生成主干的同时保留三路独立视觉表征,并通过逐层、同时刻的跨视角交互建立场景联系。模型结合时空—视角联合位置编码,在训练中引入由相机几何构建的视锥约束,引导不同镜头中空间上可能关联的区域交换信息。跨视角协同由此从无差别的特征混合,走向空间关系引导的联合预测,在保留局部视角特性的同时,加强同一操作的多视角一致性。
从具身结构约束动作,到多尺度时序驱动演化,再到空间关联引导协同,BWM-Pro 将“动作可控”与“世界一致”贯穿于同一架构,推动多视角预测从各自成像走向共同推演。
04/
牵手头部机器人厂商,让世界模型走向真实应用
考拉悠然此次与头部机器人厂商签署战略合作协议,围绕具身智能生态展开全方位合作:在技术侧共研面向真实场景的具身大脑,在业务侧联合开拓重点行业,推动具身智能从技术验证走向规模化商业落地。
此次牵手被视为具身智能产业链"大脑—本体—场景"三层协同的一次关键握手。考拉悠然将以自研悠然无界世界模型与多模态大模型为底座,提供机器人的认知、推理与任务规划具身大脑的能力;头部机器人厂商将以覆盖四足、轮足、人形三大形态的本体平台与全栈运控能力,提供可靠的物理执行载体。双方希望通过优势互补,共同构建开放、可复制、可进化的具身智能生态。
未来,双方将继续深化产学研协同,围绕更复杂、更长程的机器人操作推进悠然无界世界模型的落地应用,让前沿研究成果逐步转化为具身智能的实际应用能力。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”
