
写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09具身智能跨本体学习之Open X-Embodiment详解让22种机器人共享同一套操作经验导读机器人学习长期被“一个机器人、一套数据、一个策略”切碎不同实验室收集的数据格式不同机器人形态不同摄像头视角不同动作空间也不同。某个平台上训练得很好的策略换一条机械臂、换一个环境往往就要重新采集数据、重新训练。《Open X-Embodiment: Robotic Learning Datasets and RT-X Models》提出的核心问题很直接能不能像训练通用视觉模型和语言模型那样把不同机器人的示范数据放到一起训练一个能够跨平台迁移的机器人策略为此论文联合 21 家机构把 60 个已有机器人数据集整理成统一仓库覆盖 22 种机器人本体、超过 100 万条真实轨迹、527 类技能和 160,266 个任务在此基础上训练 RT-1-X 与 RT-2-X。这篇论文的贡献不在于发明一个全新的 Transformer而在于把“跨本体训练”变成了一项可以复用、可以比较的基础设施工作统一数据格式给出可用的动作接口提供模型检查点再用真实机器人实验验证多源数据是否真的产生正迁移。实验显示RT-1-X 在 5 个小数据域中的 4 个超过原始专用方法平均成功率提升约 50%更大的 RT-2-X 在 Google Robot 上对来自另一种机器人数据集的未见技能达到约 3 倍的成功率。猫先生认为Open X-Embodiment 最重要的价值是把“机器人数据孤岛”改写成了“可共同预训练的数据混合”。但它提供的是粗粒度的接口统一不是把不同机器人的坐标系、动力学和控制语义都变成完全相同真正的跨本体泛化仍然依赖模型容量、视觉语言预训练和目标机器人的动作解码。论文标题Open X-Embodiment: Robotic Learning Datasets and RT-X Models论文地址https://arxiv.org/abs/2310.08864项目主页https://robotics-transformer-x.github.io/GitHubhttps://github.com/google-deepmind/open_x_embodiment原文脉络从数据孤岛到 X-robot policy论文的论证路径第一说明机器人学习缺少类似 NLP、计算机视觉那样的大规模多样化预训练数据第二把 60 个机器人数据集整理成 Open X-Embodiment Repository并分析其中的本体、场景、技能和物体分布第三基于 RT-1 和 RT-2 的原始配方构造 RT-X回答异构数据能否共同训练第四在 6 种机器人上进行 3,600 次真实评测分别测试同分布性能、未见对象/环境泛化和跨本体技能迁移。1-2. 背景与相关工作为什么机器人需要跨本体数据视觉和语言模型能够依靠互联网数据获得通用能力一个重要原因是数据规模大、分布广而且不同来源可以共享相对稳定的输入输出接口。机器人则相反数据通常由某个实验室、某种机械臂、某套相机和某类任务构成。即使两个数据集都记录“抓取”一个可能输出末端位姿一个输出关节角速度相机可能安装在腕部也可能固定在桌边。已有跨机器人工作通常会显式处理本体差异例如加入机器人身份条件、学习共享动作表示、把机器人和环境表示解耦或者从人类视频中学习与本体无关的视觉表征。Open X-Embodiment 采取了更朴素但更有工程意义的路线先把大量已有数据整理到同一个仓库再直接训练一个策略观察异构数据本身能否带来正迁移。这也是论文的边界。作者没有声称一个动作向量在所有机器人上具有相同的物理意义他们希望验证的是多种机器人积累的视觉、语言和操作经验是否能在共享模型中互相帮助。3. Open X-Embodiment先把数据变成可共同训练的材料3.1 数据规模与多样性Open X-Embodiment 数据集从 34 个机器人研究实验室汇集 60 个数据集覆盖单臂、双臂和四足机器人等 22 种本体。论文统计到超过 100 万条真实轨迹、311 个场景、527 类技能、5,228 个物体和 23,486 个空间关系。数据并非简单地重复“抓取—放置”长尾技能还包括擦拭、装配、理线等语言指令则覆盖厨房、桌面和家庭环境中的多种物体关系。图 1来源论文 teaser。中间区域概括了 22 种本体、60 个数据集和 527 类技能两侧展示不同数据集中的场景与语言指令。数据分布并不均匀。Franka 相关数据集带来最多视觉场景xArm 和 Google Robot 贡献了大量轨迹很多技能仍集中在 pick-and-place 家族。这个分布事实很重要数据“超过百万条”不等于每种机器人和每种技能都拥有同样的覆盖度。图 2来源论文 Figure 1。它展示了数据量和语义多样性如何分布在不同机器人本体上也提醒我们注意长尾与头部数据的失衡。3.2 RLDS统一存储格式不强行统一所有传感器论文采用 RLDS 数据格式将每个 episode 序列化保存为 TFRecord。该格式可以容纳不同数量的 RGB/深度相机、点云、状态和动作字段并支持在主流深度学习框架中并行加载。这样做解决的是“数据如何被同一个训练管线读取”的问题。统一并不意味着抹平原始数据。每个数据集仍然可以保留自己的输入模态和动作字段训练 RT-X 时作者选择一个规范相机视角将图像缩放到公共分辨率并把原始动作转换为 7 维末端执行器动作( x , y , z , r o l l , p i t c h , y a w , g r i p p e r ) (x,y,z,roll,pitch,yaw,gripper)(x,y,z,roll,pitch,yaw,gripper)或这些量的速度形式。3.3 粗粒度动作对齐同一个向量不一定同一种运动动作在离散化之前按数据集分别归一化。模型最终输出 8 组离散 token7 个末端动作维度加 1 个 episode 结束标记每个维度均匀划分为 256 个 bin。执行时再根据目标机器人自己的归一化参数反归一化。这套设计让模型可以在一个输出头上学习不同来源的数据但作者明确保留了三个差异不同数据集的坐标系不强制对齐动作可以表示绝对位置、相对位置或速度同一个离散向量在不同机器人上可能诱发完全不同的运动。换句话说RT-X 学到的是视觉、语言和操作模式之间的共享统计结构具体物理执行仍由目标本体的解码方式决定。猫先生认为这是整篇论文最容易被误读的地方。所谓“统一动作空间”更接近一个共同的插槽和编码协议而不是一个跨机器人通用的物理控制器。这个取舍降低了数据整合门槛也把真正困难的本体差异留给模型和部署端处理。4. RT-X在同一数据混合上训练两类策略4.1 RT-1-X机器人专用的轻量 TransformerRT-1 是约 3,500 万参数的机器人策略。它读取最近 15 帧图像和语言指令ImageNet 预训练的 EfficientNet 提取视觉特征FiLM 层将语言嵌入注入视觉流得到 81 个视觉—语言 token随后由 decoder-only Transformer 输出离散动作。RT-1-X 保持 RT-1 的网络结构不变只把原本单一机器人的训练集替换为多来源机器人数据混合。这样可以把性能差异主要归因于“是否跨本体共训”而不是更换模型结构。4.2 RT-2-X把动作写成语言 tokenRT-2 的思路是把动作离散值表示成文本 token例如将一组动作写成1 128 91 241 5 101 127。因此原本用于视觉语言任务的 VLM 可以通过 co-fine-tuning 学会输出机器人动作。论文使用 RT-2-PaLI-X 变体视觉侧是 ViT语言侧是 UL2主要继承 WebLI 的互联网视觉语言预训练。图 3来源论文 Figure 2。RT-1-X 使用 FiLM-EfficientNet 与 TransformerRT-2-X 使用 ViT、语言模型和动作反解码器二者都把图像与语言指令映射为离散末端动作。两种 RT-X 的训练策略不同RT-1-X 只使用机器人数据混合RT-2-X 则把原始 VLM 数据和机器人数据大致按 1:1 共微调。实验用的机器人混合实际包含 9 种机械臂少于后来扩展到 22 种本体的完整仓库这是数据集持续增长造成的时间差不能把两者混为同一个训练规模。5. 实验设置与结果正迁移何时会出现论文在 6 种机器人上完成 3,600 次评测围绕三个问题展开共同训练是否提升同分布任务是否能带来未见对象、环境和指令的泛化模型容量、网页预训练和短历史帧各自有多重要5.1 小数据域跨本体共训带来明显增益小规模数据域包括 Kitchen Manipulation、Cable Routing、NYU Door Opening、AUTOLab UR5 和 Robot Play。RT-1-X 在其中 5 个域的 4 个超过了各自数据集作者提供的原始方法平均成功率约提升 50%。这类结果说明目标平台本身数据较少时其他机器人提供的视觉场景、物体交互和语言动作模式可以充当有效的先验。图 4来源论文 Figure 3。RT-1-X 在 5 个小数据域中有 4 个超过原始方法右侧 Mean 显示跨数据集共训的平均优势。5.2 大数据域小模型会欠拟合大模型才吃得下异构数据在 Bridge 和 RT-1 这两个数据量较大的域中RT-1-X 反而不如只在目标数据上训练的 RT-1说明 3,500 万参数的模型难以同时容纳更多机器人、更复杂动作分布和更宽的视觉变化。把模型换成 550 亿参数的 RT-2-X 后Bridge 两个评测设置分别达到 50% 和 30%Google Robot 的 6 技能评测达到 91%表现接近或超过单域基线。这组结果给出一个很具体的 scaling 结论数据混合扩大后模型容量不是锦上添花而是能否吸收异构经验的前提。如果模型太小跨本体训练可能只表现为欠拟合和负迁移。5.3 跨本体涌现技能Bridge 的经验迁移到 Google Robot作者专门在 Google Robot 上测试原 RT-2 数据中没有出现、但 Bridge 数据集的 WidowX 机器人中出现过的技能。例如移动未见位置的物体、理解相对空间关系和改变物体与容器之间的关系。RT-2 的涌现技能成功率为 27.3%RT-2-X 提升到 75.8%约为 3 倍。图 5来源论文 Figure 4。上半部分考察绝对位置和物体相对运动下半部分考察介词改变带来的行为差异这些技能在 Bridge 中有数据但不在 Google Robot 的原始训练数据中。去掉 Bridge 数据后RT-2-X 的涌现技能成功率降到 42.8%说明增益并非单纯来自更大训练量而与包含相关技能的跨本体数据有关。不过未见物体、背景和环境的通用视觉泛化上RT-2 与 RT-2-X 大致相当这也符合 RT-2 已经具备网页视觉语言预训练能力的事实。5.4 消融网页预训练、历史帧和参数规模缺一不可论文的消融结果可以用一张表概括设置涌现技能成功率RT-2 泛化评测说明RT-255B27.3%62%原始 Google Robot 数据RT-2-X55B75.8%61%完整机器人数据混合RT-2-X55B42.8%54%去掉 BridgeRT-2-X5B2 帧历史44.4%52%有网页预训练RT-2-X5B无历史14.5%30%有网页预训练RT-2-X5B2 帧历史0%1%从头训练RT-2-X5B2 帧历史48.7%47%网页预训练但不共微调表中最稳定的结论有三个短历史帧明显提高泛化网页预训练几乎是大模型获得语义和视觉常识的必要条件55B 模型比 5B 模型更能从跨机器人数据中吸收新技能。论文还发现在多样机器人数据上单纯微调和共微调的差异不像原 RT-2 论文中那么大作者将其归因于机器人数据本身已经足够多样。猫先生认为RT-X 的实验结果不是“数据越多越好”这么简单而是一个三因素耦合数据要覆盖真正相关的技能模型要有足够容量骨干还要带着网页预训练获得语义先验。少了任何一个因素跨本体数据都可能变成噪声混合。6. 讨论、局限与可复现性Open X-Embodiment 把数据、RLDS 工具和 RT-X 检查点公开出来降低了后续研究进入 X-embodiment 学习的门槛。但论文也明确列出边界。第一实验没有覆盖感知和执行模态差异极大的机器人例如不同类型的触觉、全身控制和复杂移动平台22 种本体并不等于所有机器人形态。第二主要评测仍发生在训练数据中已经出现过的机器人上论文没有系统回答“换到一个完全新本体时需要多少适配数据”。第三数据分布存在明显头部和长尾Franka、xArm、Google Robot 的数据量不能代表整个机器人世界。第四粗粒度动作对齐没有消除坐标系、动力学和控制频率差异实际部署仍要处理每个平台的安全约束、延迟和动作解码。从复现角度看最值得沿用的不是某个固定的 RT-1-X checkpoint而是三件事用统一序列格式管理 episode在数据集级别保留动作归一化和本体元数据把“单域基线、跨域共训模型、去掉相关数据的消融”同时放进评测。否则即使看到一个更高成功率也很难判断它来自数据规模、模型容量还是某个隐藏的本体特化。总结Open X-Embodiment 把机器人学习推向“共同预训练”这篇论文的价值可以收在三点它把 60 个机器人数据集整理成一个可下载、可加载、可继续扩展的共同数据底座而不是只展示一个封闭实验室里的模型。它证明跨本体共训确实能产生正迁移小数据域的 RT-1-X 平均提升约 50%RT-2-X 在另一种机器人数据中学到的技能上达到约 3 倍成功率。它同时证明了这条路线的条件统一接口仍然是粗粒度的模型容量和网页预训练很关键且对完全新本体、不同传感器和动作动力学的泛化还没有被解决。如果只记住一句话可以这样理解 Open X-Embodiment机器人基础模型的第一步不是先设计一个“万能机械臂”而是先让不同机器人产生的数据能够被同一个训练系统看见、比较和共同学习。推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列