基模大满贯!原力灵机DM0.5横扫六大具身榜单

基模大满贯!原力灵机DM0.5横扫六大具身榜单

机器人前瞻(公众号:robot_pro)

作者 | 周加琦

编辑 | 漠影

具身智能模型正在进入“全面比拼”

过去,不同具身模型往往在特定任务、机器人或单一评测中各有所长,但当评测维度进一步覆盖指令理解、空间推理等多层次后,能够在多个榜单持续保持领先的模型寥寥无几。

机器人面对复杂、长时序任务时,感知、理解、推理、决策、控制和纠错缺一不可,任何一项明显短板,都可能成为整个任务执行的瓶颈。没有“全科优秀”,具身模型很难走进真实世界

近日,原力灵机DM0.5一口气拿下六个第一,登顶六大评测榜单。其中在由智元发起,联合高校、科研机构、开源社区及机器人企业等共同建设的RoboColiseum评测中,DM0.5拿下四大榜首,成为目前该榜单体系中唯一一个全部评测均排名第一的模型

基模大满贯!原力灵机DM0.5横扫六大具身榜单

从单项领先到多榜登顶,DM0.5展现的不只是某一项任务上的“长板”,而是多维度的综合能力

更值得关注的是,这些能力并非在榜单出现后才被“补齐”。从数据规模到模型架构,再到训练和推理效率,DM0.5在基础能力上的系统升级,为其在不同任务、不同环境中的泛化表现提供了支撑。

那么,一个4B规模的具身模型,为什么能够连续拿下六大评测榜单第一?DM0.5究竟做对了什么?

GitHub链接:https://github.com/dexmal/opendm

Hugging Face链接:https://huggingface.co/Dexmal/DM05

Tech Blog链接:https://www.dexmal.com/blog/dm0.5

一、登顶六大评测榜首,RoboColiseum四项评测全部第一

现实的任务长且复杂,变量也更多。一个任务包含多个子目标,物体位置、摆放方式和周围环境随时会发生变化,模型需要持续利用信息来判断当前状态。如何减少对特定任务、特定场景和固定动作模式的依赖,提升面对未知任务和环境时的泛化能力,是很大的技术挑战。

原力灵机将DM0.5放入RoboColiseum的多个维度能力校验中,分别从指令遵循空间推理鲁棒性通用操作四个方面考察模型能力。

指令遵循考验模型能否准确理解任务目标,将语言指令转化为对应机器人的行为;空间推理则关注模型能否理解物体位置及空间关系,据此完成相应的任务。

鲁棒性主要测试环境发生变化或受到干扰时,模型能否根据新的状态调整行为;通用操作考察模型能否将理解、推理进一步落实到实际操作,在不同任务保持稳定的执行能力。

结果显示,DM0.5领先HiDream-O1-Embodied、GigaBrain-0.7等模型。其中空间推理评测分数为0.6146,大幅领先一众模型。

基模大满贯!原力灵机DM0.5横扫六大具身榜单

另外,DM0.5还以24.90的综合得分登顶评测基准RoboDojo。与RoboColiseum侧重多维能力考察不同,RoboDojo更加关注模型在机器人任务中的记忆、精细操作与长时序执行能力。

基模大满贯!原力灵机DM0.5横扫六大具身榜单

通过仿真侧的42个任务与真机侧的18个任务,RoboDojo考察模型在不同任务设置下的操作表现,覆盖泛化、记忆、精准、长时序和开放语义理解多个维度。

任务数量和评测维度的扩展,使模型需要在不同操作要求下持续调用历史信息、调整执行策略,而非依赖单一任务中的固定动作模式。

除此之外,DM0.5还在LIBERO、RoboTwin 2.0、RoboChallenge Table30 v2、VLA-Arena等评测中取得SOTA,覆盖操作、双臂协同以及不同任务场景下的机器人控制能力。

基模大满贯!原力灵机DM0.5横扫六大具身榜单

基模大满贯!原力灵机DM0.5横扫六大具身榜单

二、15万小时数据+4B架构,DM0.5强化跨任务泛化能力

多项评测同时领先,首先拼的是模型见过多少、学过什么。机器人面对的真实任务很难被几套固定动作覆盖:换一个物体、调整一下摆放位置,甚至改变任务步骤,都可能要求模型重新判断。

如果训练数据集中在少数任务和固定场景,模型很容易记住“怎么做”,却难以掌握“为什么这样做”,一旦遇到没见过的任务,泛化能力就会明显下降。

因此,具身模型要获得跨任务、跨场景能力,训练数据需要覆盖足够丰富的任务、环境和操作变化。

原力灵机此次将DM0.5的训练数据规模进一步扩大至15万小时,包含5万小时真机数据10万小时Egocentric数据,覆盖不同机器人本体、任务类型和操作过程,让模型在训练阶段接触更多样的任务组合和环境变化。

更重要的是,这些数据并不是把一个个动作简单堆在一起。一项复杂任务中,前一个动作可能改变物体位置,环境变化又会影响后续决策。如果模型只学习“某个画面对应什么动作”,就很难处理这种连续变化。

因此,完整的任务轨迹实际上提供了另一类信息——动作为什么发生,以及前后的状态是如何关联的

原力灵机还进一步构建了100万平方米的场景来重建数据,让模型接触更加丰富的空间结构和环境变化,减少模型对有限训练场景的依赖,同时缩小仿真训练与真实环境之间的差距。

数据解决了“让模型见得足够多”的问题,接下来还要解决“模型能不能把这些经验用起来”。DM0.5采用4B规模架构,加入长时记忆具身思维链轨迹对齐等能力。

基模大满贯!原力灵机DM0.5横扫六大具身榜单

其中,DM0.5最长可利用约60秒的历史信息,把此前的信息带入当前决策,而不是每一步都“重新开始”。

但知道“发生了什么”还不够,模型还需要判断“接下来为什么这么做”。DM0.5强化任务层面的推理,让模型同时考虑语言指令、机器人自身状态和当前环境,在执行过程中判断目标对象、任务进度以及后续动作,这是它能够应对未知任务的重要基础。

最后一个问题是,模型判断出来了,机器人能不能及时、稳定地执行?DM0.5则进一步优化推理系统,将核心模型延迟从534.04ms压缩到57.49ms,达到9.29倍加速。同时,LIBERO测试成功率基本保持不变。

基模大满贯!原力灵机DM0.5横扫六大具身榜单

这意味着DM0.5做的并不是单纯把模型“做大”或者把数据“采多”,而是在数据覆盖、任务状态理解、连续决策和动作执行几个环节同时补齐能力。前面的多项榜单成绩,实际上正是这些能力共同作用后的结果。

三、抗干扰、能修正、会控力,DM0.5在真实任务中验证

机器人真正进入真实环境后,相机视角变化、人员临时介入、物体位置变化以及连续高频任务,都会让预设动作失效。因此,具身模型不仅要完成任务,还要能够持续感知环境变化、调整动作,并在执行出错后及时修正。

DM0.5能够根据新的视觉信息重新判断当前状态,并调整后续动作。在测试中,即使外部突然改变相机视角,机器人仍能保持任务执行;当人直接介入操作过程时,机器人也能识别环境状态,并自适应完成后续动作。

这背后体现的是DM0.5的环境状态理解和动态决策能力

另外,在具体任务中,DM0.5也展现出对不同操作难点的适应能力。

会拼积木,完成亚毫米级装配。机器人可实现在0.1到1毫米的范围内,完成对准和扣合。面对存在制造公差的微型积木,DM0.5还会先对准位置,再轻轻晃动、调整,一点点把积木卡进正确的位置。

如果没拼进去,机器人也不会继续往下做,而是会停下来重新调整。

能处理黄瓜,会控力。削、切黄瓜这类任务看着简单,但黄瓜是软的,力气大了容易压坏,力气小了又切不进去。DM0.5能够根据关节电机的电流变化,判断当前接触力度,再实时调整动作,让机器人在切削过程中保持合适的力道。

还会连环分拣,平均3秒一单。DM0.5不依赖预设脚本,而是根据实时画面判断包裹大小、材质等,连续完成分拣,平均3秒一单,准确率超过99%。

此外,原力灵机也在推动DM0.5进入产业,开展商业应用验证。目前,在某大型国际零售商仓储中,多台搭载DM0.5的机器人正与其他类型机器人协同作业,完成商品搬运与分拣;在某大型3C制造商工厂,搭载DM0.5的机器人则参与包装及废料回收等工作。

基模大满贯!原力灵机DM0.5横扫六大具身榜单

从仓储物流到3C制造,DM0.5已经开始覆盖真实生产中的具体任务。相比测试,这些场景对模型的环境适应、持续执行以及多机器人协同能力提出了更高要求。

结语:单项冠军能赢下一个榜单,“全科能力”才能走进真实产线

DM0.5登顶六大榜单的意义,并不只是多拿了几个第一,更在于它展示了具身模型竞争正在进入一个新的阶段。

榜单可以拼单项冠军,产线却不允许模型偏科。真实生产不会把任务拆成一道道标准题目,机器人既要听懂指令、理解空间,又要应对环境变化、持续执行,并在出现偏差后及时修正。任何一个环节掉队,都可能让前面的能力优势失去意义。

这也意味着,具身模型的竞争正在从“单项能力有多强”,转向“多项能力能否同时工作”。对于模型而言,“全科能力”不再只是评测中的加分项,而是进入真实产线的基础门槛。能赢下一场榜单,证明模型有长板;能在真实产线持续把任务做下来,才真正证明模型具备产业价值。