具身智能跨本体学习之Open X-Embodiment详解:让22种机器人共享同一套操作经验
2026/8/25 13:54:31 网站建设 项目流程

写在前面

从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git

魔方AI空间
猫先生
从零走向AGI
面试面经

AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09

具身智能跨本体学习之Open X-Embodiment详解:让22种机器人共享同一套操作经验

导读

机器人学习长期被“一个机器人、一套数据、一个策略”切碎:不同实验室收集的数据格式不同,机器人形态不同,摄像头视角不同,动作空间也不同。某个平台上训练得很好的策略,换一条机械臂、换一个环境,往往就要重新采集数据、重新训练。

《Open X-Embodiment: Robotic Learning Datasets and RT-X Models》提出的核心问题很直接:能不能像训练通用视觉模型和语言模型那样,把不同机器人的示范数据放到一起,训练一个能够跨平台迁移的机器人策略?为此,论文联合 21 家机构,把 60 个已有机器人数据集整理成统一仓库,覆盖 22 种机器人本体、超过 100 万条真实轨迹、527 类技能和 160,266 个任务;在此基础上训练 RT-1-X 与 RT-2-X。

这篇论文的贡献不在于发明一个全新的 Transformer,而在于把“跨本体训练”变成了一项可以复用、可以比较的基础设施工作:统一数据格式,给出可用的动作接口,提供模型检查点,再用真实机器人实验验证多源数据是否真的产生正迁移。实验显示,RT-1-X 在 5 个小数据域中的 4 个超过原始专用方法,平均成功率提升约 50%;更大的 RT-2-X 在 Google Robot 上对来自另一种机器人数据集的未见技能,达到约 3 倍的成功率。

猫先生认为,Open X-Embodiment 最重要的价值,是把“机器人数据孤岛”改写成了“可共同预训练的数据混合”。但它提供的是粗粒度的接口统一,不是把不同机器人的坐标系、动力学和控制语义都变成完全相同;真正的跨本体泛化,仍然依赖模型容量、视觉语言预训练和目标机器人的动作解码。

论文标题:Open X-Embodiment: Robotic Learning Datasets and RT-X Models
论文地址:https://arxiv.org/abs/2310.08864
项目主页:https://robotics-transformer-x.github.io/
GitHub:https://github.com/google-deepmind/open_x_embodiment

原文脉络:从数据孤岛到 X-robot policy

论文的论证路径:第一,说明机器人学习缺少类似 NLP、计算机视觉那样的大规模多样化预训练数据;第二,把 60 个机器人数据集整理成 Open X-Embodiment Repository,并分析其中的本体、场景、技能和物体分布;第三,基于 RT-1 和 RT-2 的原始配方构造 RT-X,回答异构数据能否共同训练;第四,在 6 种机器人上进行 3,600 次真实评测,分别测试同分布性能、未见对象/环境泛化和跨本体技能迁移。

1-2. 背景与相关工作:为什么机器人需要跨本体数据?

视觉和语言模型能够依靠互联网数据获得通用能力,一个重要原因是数据规模大、分布广,而且不同来源可以共享相对稳定的输入输出接口。机器人则相反:数据通常由某个实验室、某种机械臂、某套相机和某类任务构成。即使两个数据集都记录“抓取”,一个可能输出末端位姿,一个输出关节角速度;相机可能安装在腕部,也可能固定在桌边。

已有跨机器人工作通常会显式处理本体差异,例如加入机器人身份条件、学习共享动作表示、把机器人和环境表示解耦,或者从人类视频中学习与本体无关的视觉表征。Open X-Embodiment 采取了更朴素但更有工程意义的路线:先把大量已有数据整理到同一个仓库,再直接训练一个策略,观察异构数据本身能否带来正迁移。

这也是论文的边界。作者没有声称一个动作向量在所有机器人上具有相同的物理意义;他们希望验证的是,多种机器人积累的视觉、语言和操作经验,是否能在共享模型中互相帮助。

3. Open X-Embodiment:先把数据变成可共同训练的材料

3.1 数据规模与多样性

Open X-Embodiment 数据集从 34 个机器人研究实验室汇集 60 个数据集,覆盖单臂、双臂和四足机器人等 22 种本体。论文统计到超过 100 万条真实轨迹、311 个场景、527 类技能、5,228 个物体和 23,486 个空间关系。数据并非简单地重复“抓取—放置”:长尾技能还包括擦拭、装配、理线等,语言指令则覆盖厨房、桌面和家庭环境中的多种物体关系。


图 1:来源:论文 teaser。中间区域概括了 22 种本体、60 个数据集和 527 类技能,两侧展示不同数据集中的场景与语言指令。

数据分布并不均匀。Franka 相关数据集带来最多视觉场景,xArm 和 Google Robot 贡献了大量轨迹,很多技能仍集中在 pick-and-place 家族。这个分布事实很重要:数据“超过百万条”不等于每种机器人和每种技能都拥有同样的覆盖度。


图 2:来源:论文 Figure 1。它展示了数据量和语义多样性如何分布在不同机器人本体上,也提醒我们注意长尾与头部数据的失衡。

3.2 RLDS:统一存储格式,不强行统一所有传感器

论文采用 RLDS 数据格式,将每个 episode 序列化保存为 TFRecord。该格式可以容纳不同数量的 RGB/深度相机、点云、状态和动作字段,并支持在主流深度学习框架中并行加载。这样做解决的是“数据如何被同一个训练管线读取”的问题。

统一并不意味着抹平原始数据。每个数据集仍然可以保留自己的输入模态和动作字段;训练 RT-X 时,作者选择一个规范相机视角,将图像缩放到公共分辨率,并把原始动作转换为 7 维末端执行器动作:( x , y , z , r o l l , p i t c h , y a w , g r i p p e r ) (x,y,z,roll,pitch,yaw,gripper)(x,y,z,roll,pitch,yaw,gripper),或这些量的速度形式。

3.3 粗粒度动作对齐:同一个向量,不一定同一种运动

动作在离散化之前按数据集分别归一化。模型最终输出 8 组离散 token:7 个末端动作维度,加 1 个 episode 结束标记,每个维度均匀划分为 256 个 bin。执行时,再根据目标机器人自己的归一化参数反归一化。

这套设计让模型可以在一个输出头上学习不同来源的数据,但作者明确保留了三个差异:不同数据集的坐标系不强制对齐;动作可以表示绝对位置、相对位置或速度;同一个离散向量在不同机器人上可能诱发完全不同的运动。换句话说,RT-X 学到的是视觉、语言和操作模式之间的共享统计结构,具体物理执行仍由目标本体的解码方式决定。

猫先生认为,这是整篇论文最容易被误读的地方。所谓“统一动作空间”更接近一个共同的插槽和编码协议,而不是一个跨机器人通用的物理控制器。这个取舍降低了数据整合门槛,也把真正困难的本体差异留给模型和部署端处理。

4. RT-X:在同一数据混合上训练两类策略

4.1 RT-1-X:机器人专用的轻量 Transformer

RT-1 是约 3,500 万参数的机器人策略。它读取最近 15 帧图像和语言指令:ImageNet 预训练的 EfficientNet 提取视觉特征,FiLM 层将语言嵌入注入视觉流,得到 81 个视觉—语言 token,随后由 decoder-only Transformer 输出离散动作。

RT-1-X 保持 RT-1 的网络结构不变,只把原本单一机器人的训练集替换为多来源机器人数据混合。这样可以把性能差异主要归因于“是否跨本体共训”,而不是更换模型结构。

4.2 RT-2-X:把动作写成语言 token

RT-2 的思路是把动作离散值表示成文本 token,例如将一组动作写成1 128 91 241 5 101 127。因此,原本用于视觉语言任务的 VLM 可以通过 co-fine-tuning 学会输出机器人动作。论文使用 RT-2-PaLI-X 变体,视觉侧是 ViT,语言侧是 UL2,主要继承 WebLI 的互联网视觉语言预训练。


图 3:来源:论文 Figure 2。RT-1-X 使用 FiLM-EfficientNet 与 Transformer;RT-2-X 使用 ViT、语言模型和动作反解码器,二者都把图像与语言指令映射为离散末端动作。

两种 RT-X 的训练策略不同:RT-1-X 只使用机器人数据混合;RT-2-X 则把原始 VLM 数据和机器人数据大致按 1:1 共微调。实验用的机器人混合实际包含 9 种机械臂,少于后来扩展到 22 种本体的完整仓库,这是数据集持续增长造成的时间差,不能把两者混为同一个训练规模。

5. 实验设置与结果:正迁移何时会出现?

论文在 6 种机器人上完成 3,600 次评测,围绕三个问题展开:共同训练是否提升同分布任务?是否能带来未见对象、环境和指令的泛化?模型容量、网页预训练和短历史帧各自有多重要?

5.1 小数据域:跨本体共训带来明显增益

小规模数据域包括 Kitchen Manipulation、Cable Routing、NYU Door Opening、AUTOLab UR5 和 Robot Play。RT-1-X 在其中 5 个域的 4 个超过了各自数据集作者提供的原始方法,平均成功率约提升 50%。这类结果说明,目标平台本身数据较少时,其他机器人提供的视觉场景、物体交互和语言动作模式可以充当有效的先验。


图 4:来源:论文 Figure 3。RT-1-X 在 5 个小数据域中有 4 个超过原始方法,右侧 Mean 显示跨数据集共训的平均优势。

5.2 大数据域:小模型会欠拟合,大模型才吃得下异构数据

在 Bridge 和 RT-1 这两个数据量较大的域中,RT-1-X 反而不如只在目标数据上训练的 RT-1,说明 3,500 万参数的模型难以同时容纳更多机器人、更复杂动作分布和更宽的视觉变化。把模型换成 550 亿参数的 RT-2-X 后,Bridge 两个评测设置分别达到 50% 和 30%,Google Robot 的 6 技能评测达到 91%,表现接近或超过单域基线。

这组结果给出一个很具体的 scaling 结论:数据混合扩大后,模型容量不是锦上添花,而是能否吸收异构经验的前提。如果模型太小,跨本体训练可能只表现为欠拟合和负迁移。

5.3 跨本体涌现技能:Bridge 的经验迁移到 Google Robot

作者专门在 Google Robot 上测试原 RT-2 数据中没有出现、但 Bridge 数据集的 WidowX 机器人中出现过的技能。例如移动未见位置的物体、理解相对空间关系和改变物体与容器之间的关系。RT-2 的涌现技能成功率为 27.3%,RT-2-X 提升到 75.8%,约为 3 倍。


图 5:来源:论文 Figure 4。上半部分考察绝对位置和物体相对运动,下半部分考察介词改变带来的行为差异;这些技能在 Bridge 中有数据,但不在 Google Robot 的原始训练数据中。

去掉 Bridge 数据后,RT-2-X 的涌现技能成功率降到 42.8%,说明增益并非单纯来自更大训练量,而与包含相关技能的跨本体数据有关。不过,未见物体、背景和环境的通用视觉泛化上,RT-2 与 RT-2-X 大致相当,这也符合 RT-2 已经具备网页视觉语言预训练能力的事实。

5.4 消融:网页预训练、历史帧和参数规模缺一不可

论文的消融结果可以用一张表概括:

设置涌现技能成功率RT-2 泛化评测说明
RT-2,55B27.3%62%原始 Google Robot 数据
RT-2-X,55B75.8%61%完整机器人数据混合
RT-2-X,55B42.8%54%去掉 Bridge
RT-2-X,5B,2 帧历史44.4%52%有网页预训练
RT-2-X,5B,无历史14.5%30%有网页预训练
RT-2-X,5B,2 帧历史0%1%从头训练
RT-2-X,5B,2 帧历史48.7%47%网页预训练但不共微调

表中最稳定的结论有三个:短历史帧明显提高泛化;网页预训练几乎是大模型获得语义和视觉常识的必要条件;55B 模型比 5B 模型更能从跨机器人数据中吸收新技能。论文还发现,在多样机器人数据上,单纯微调和共微调的差异不像原 RT-2 论文中那么大,作者将其归因于机器人数据本身已经足够多样。

猫先生认为,RT-X 的实验结果不是“数据越多越好”这么简单,而是一个三因素耦合:数据要覆盖真正相关的技能,模型要有足够容量,骨干还要带着网页预训练获得语义先验。少了任何一个因素,跨本体数据都可能变成噪声混合。

6. 讨论、局限与可复现性

Open X-Embodiment 把数据、RLDS 工具和 RT-X 检查点公开出来,降低了后续研究进入 X-embodiment 学习的门槛。但论文也明确列出边界。

第一,实验没有覆盖感知和执行模态差异极大的机器人,例如不同类型的触觉、全身控制和复杂移动平台;22 种本体并不等于所有机器人形态。第二,主要评测仍发生在训练数据中已经出现过的机器人上,论文没有系统回答“换到一个完全新本体时需要多少适配数据”。第三,数据分布存在明显头部和长尾,Franka、xArm、Google Robot 的数据量不能代表整个机器人世界。第四,粗粒度动作对齐没有消除坐标系、动力学和控制频率差异,实际部署仍要处理每个平台的安全约束、延迟和动作解码。

从复现角度看,最值得沿用的不是某个固定的 RT-1-X checkpoint,而是三件事:用统一序列格式管理 episode;在数据集级别保留动作归一化和本体元数据;把“单域基线、跨域共训模型、去掉相关数据的消融”同时放进评测。否则,即使看到一个更高成功率,也很难判断它来自数据规模、模型容量,还是某个隐藏的本体特化。

总结:Open X-Embodiment 把机器人学习推向“共同预训练”

这篇论文的价值可以收在三点:

  1. 它把 60 个机器人数据集整理成一个可下载、可加载、可继续扩展的共同数据底座,而不是只展示一个封闭实验室里的模型。
  2. 它证明跨本体共训确实能产生正迁移:小数据域的 RT-1-X 平均提升约 50%,RT-2-X 在另一种机器人数据中学到的技能上达到约 3 倍成功率。
  3. 它同时证明了这条路线的条件:统一接口仍然是粗粒度的,模型容量和网页预训练很关键,且对完全新本体、不同传感器和动作动力学的泛化还没有被解决。

如果只记住一句话,可以这样理解 Open X-Embodiment:机器人基础模型的第一步,不是先设计一个“万能机械臂”,而是先让不同机器人产生的数据能够被同一个训练系统看见、比较和共同学习。

推荐阅读

► 技术资讯: 魔方 AI 新视界

► 项目应用:开源视界

► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询