☰
DM0.5连续霸榜各大评测,具身预训练的价值正在显现
2026/9/25 18:25:17 网站建设 项目流程

具身智能的榜单越来越多,模型成绩也在不断刷新。

相比于看谁拿第一,另一个问题更值得关注:这些榜单,究竟在向机器人提出什么要求?

同样是抓起一个物体,但完成抓取只是第一层。如果指令指定了颜色、大小,机器人要先选对目标;如果任务要求放到某个物体旁边,它要判断空间关系;如果相机视角变化、目标被移动,或者有人突然打断,它还要根据新的观测继续修正动作。

问题正在变得更难。

一次任务成功,背后需要指令理解、空间判断、扰动适应和动作执行同时成立。

抓得准,只是其中一部分。

进入物理世界之前,测量模型的那把尺子尤其重要,因为它提供了一个有效的参考标准。

这两年,各类benchmark也随着真实要求,越来越丰富。

而最新的RoboColiseum正是为观察这些要求提供了一个具体入口。

它是目前行业内维度最丰富的评测体系,由NVIDIA和抱抱脸等多个机构联合推出。

这个仿真评测平台设置了指令跟随、空间理解、扰动适应和通用操作四个子榜。

如果结合到一起看,就能更清晰的了解,当下的具身模型正在接受怎样的检验:从空间感知到操作,再到鲁棒性测试。

近日,我们也发现了这个榜单的四个子任务被同一个模型占了榜首,来自原力灵机的DM0.5。

原文链接:DM0.5连续霸榜各大评测,具身预训练的价值正在显现

被同一个模型霸榜DM0.5 是RoboColiseum 榜单中唯一一个所有评测均排名第一的模型。

先看这次榜单的结果。

在 RoboColiseum 的四个子榜上,原力灵机DM0.5 均排名第一:Instruction Following 0.8444、Spatial Reasoning 0.6146、Robustness 0.7344、General Manipulation 0.6370。

不过SOTA之外,更需要关注的是,它的底层能力搭建是怎么样的,以及当下这些要求它是怎么满足的。

因为这四个子榜对应的,其实是机器人完成真实任务前必须连续通过的几道关:先听懂指令,再判断空间关系,过程中扛住扰动,最后把理解转成稳定动作。

真实机器人任务很少只考单项能力。

一句“把红色方块放到杯子左边”,背后同时有目标识别、空间定位、动作规划和终止判断;过程中一旦目标被挪动,模型还要重新理解当前状态,而不是沿着原轨迹硬走。

上面的综合测试合格才是迈向真实场景的第一步。

所以 DM0.5 的分数之外,需要看的,更接近真实世界的要求开始被满足。

为什么 DM0.5 能同时登顶四个子榜?

单榜冲高和四榜同时靠前,是两种难度。

RoboColiseum 的四个子榜中任何一个环节偏科,都会在另一张榜单上暴露出来。

问题由此变成:DM0.5 到底做对了什么?

我们和原力灵机的人聊了聊,他们解释说,DM0.5 的四榜第一主要要回到预训练能力本身。

数据覆盖决定它是否见过足够复杂的任务形态,网络结构决定它能否把指令、环境和动作连起来,SFT 是最后一步适配,把这些能力迁移到 RoboColiseum 的构型和任务设置里。

把三类高质量数据进行组合,取长补短。

DM0.5 的数据优势,不单是规模,也覆盖了具身任务的关键变量:动作、空间和环境。

我们了解下来是这样的。

DM0.5 的数据覆盖导航、抓取、全身控制三大任务,以及六类机器人本体。

其中,真机数据达到 5 万小时,覆盖 100 多种动作,并实现秒级精细指令动作对齐;Egocentric 数据达到 10 万小时,支持毫米级高精度 3D Landmark 生成;场景重建数据达到 100 万平,用于建模复杂室内环境,缩小 Sim2Real Gap。

这三类数据对应的是 RoboColiseum 的四类考点:真机操作数据支撑指令到动作的对齐,第一视角和 3D Landmark 支撑空间推理,场景重建数据支撑扰动和环境泛化,多任务、多本体覆盖支撑通用操作。

四榜同时靠前,首先需要模型在训练阶段就见过足够多的任务形态、空间关系和环境变化。

DM0.5 的数据融合,解决的正是这个覆盖面问题。

在上下文信息压缩、思维链、轨迹对齐上来优化结构

数据之后,更关键的是结构。

对机器人来说,长程任务最怕三件事:只看当前一帧就下判断,听懂了指令但不知道任务进展,学动作时又被不同示教轨迹里的速度和路径差异带偏。

DM0.5 的三项结构设计,基本就是围绕这三件事展开。

1)Context Abstraction Layer。

机器人执行任务时,当前画面往往不够用。刚才擦到了哪里,目标是不是被短暂遮挡,上一段动作有没有把物体推偏,这些历史信息都会影响下一步决策。

Context Abstraction Layer 做的是把上下文压缩进模型可用的状态里,让 DM0.5 原生支持最长 60 秒记忆。

2)Embodiment CoT Tasks。

记住还不够,模型还要知道自己在做什么、做到哪一步、下一步该不该继续。

DM0.5 通过 11 项具身推理任务,把目标定位、子任务预测、任务结束判断、未来世界状态描述,以及机械臂、夹爪、主动执行器状态生成放进预训练。它训练的是“指令、本体、环境”之间的连续推理能力,而不是一句指令直接映射一个动作。

3)Trajectory Alignment Layer for Action Learning。

最后还是要回到动作。

真实示教数据天然不整齐。同一个任务,有人做得快,有人做得慢,路径、姿态、停顿位置也会有差异。如果直接逐点监督,模型很容易把这些轨迹差异也学进去。

Trajectory Alignment Layer 通过约束动态规划计算最优匹配,把动作监督从“对齐某个时间点”转向“对齐整段动作意图”。这样模型更容易学到稳定的操作逻辑,而不是被每条示教里的细节波动牵着走。

这三项设计合在一起,解决的是长程机器人任务里最关键的一条链路:历史要记住,任务要想清,动作要对齐。

不仅仅是榜首,还是模型全科优秀

榜单之外,下一个问题很自然是:这些能力落到真实机器人任务里,能否继续成立。

这一点,可以从原力灵机之前对外展示的任务来看。

主要集中在几类:微型积木拼装、削黄瓜、灵巧手切黄瓜、物流单件分离,以及相机扰动和人类动作干扰。

它们对应的不是同一种能力,而是同一个模型在精度、力控、跨本体操作和稳定性上的连续表现。

先看精度。

微型积木任务中,最小组件宽度不到 1 厘米,机器人需要在 0.1 到 1 毫米尺度内完成抓取和扣合;作为参照,人手自然抖动约为 0.3 到 1 毫米。

这里比较难的是,积木存在工艺公差,直接下压容易错位卡死。DM0.5 是先对齐,再通过轻微震动和下压完成装配;出现角度偏差后,还能停顿、调整姿态并修正位置。据悉,平均每台机器人每 12 秒完成一次拼装。

再看力控和本体迁移。

削黄瓜任务中,DM0.5 通过关节电机电流值实时感知作用力大小,进而判断接触力;这要求模型同时处理黄瓜表面、刀具角度和机械臂轨迹的变化。

灵巧手切黄瓜则把难度推到 58 个自由度的人形机器人上,通过 DM0.5 模型加特定后训练完成长程操作,涉及视觉理解、抓握稳定、刀具控制和节奏保持。

最后是稳定性和抗干扰。

相机扰动考视角变化后的继续执行,人类动作干扰考任务被打断后的状态理解和动作修正;物流中转站单件分离任务,则把模型放到持续运行的工业节拍里。我们在WAIC和WRC上看到他们的快递t分拣,在包裹尺寸、材质、摆放姿态都不固定的情况下,DM0.5 依靠实时视觉识别和决策完成分拣,平均 3 秒一单,准确率超过 99%。

DM0.5在精细定位、柔性接触、高自由度控制、长程执行和抗干扰恢复上都有可观察的能力信号。

单卡 9.29 倍加速做到 57 ms

之外,我们还了解到DM0.5的系统推理效率有很大幅度提升。目前已经做到单卡57.49ms。

不过这个只是另一维度的优化,57ms 和 RoboColiseum 四榜第一没有必然联系。

推理加速的价值在另一层。

真实机器人不是离线答题。模型响应太慢,前面学到的理解和动作能力就很难及时进入闭环。

DM0.5 在推理侧联合优化,将模型核心延迟从 534.04 ms 降到 57.49 ms,累计加速 9.29 倍,延迟降低 89.2%。

而且,这次优化基本没有牺牲精度。

在 2,000 个 LIBERO episodes 上,成功率从 98.45% 到 98.40%,保持基本稳定。

写在最后

仿真评测正在成为具身模型进入真实世界前的必测关。

真实机器人测试成本太高。

每一次真机验证,都涉及本体、场地、物料、复位、人工和安全问题。

模型如果在仿真里的指令理解、空间判断、扰动适应和通用操作上已经暴露短板,直接进入真实场景,只会让问题在更昂贵的环节里出现。

所以,评测维度越多,越能提前照出模型的问题。

只看一次抓放,很难判断模型是否真正理解指令;只看固定场景,也看不出它能否处理目标移动、视角变化和人为打断。

RoboColiseum 的价值就在于,把这些能力拆开测,再放到同一套体系里比较。

从这个角度看,原力灵机DM0.5 四榜第一的意义不只是分数领先,而是它在更接近真实任务要求的综合测试里,没有明显偏科。

当然,仿真评测只是第一步。

模型最后还是要回到真实机器人身上,接受真实任务、真实干扰和真实节拍的检验。

榜单给出标准化分数,真机任务给出物理世界里的能力切面。

两者放在一起,才更接近具身基础模型真正要面对的竞争。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询