
Talk 2: Improving Embodied Policy with Compositional World Model 基于组合式世界模型优化具身智能策略Li Chen from OpenDriveLab Archon一、存在的问题如今具身智能策略已经在将 “观测画面 指令→动作” 的映射方面变得非常强大。但大量任务失败并非源于对当前画面理解错误而是策略无法预判动作下一步可能带来什么结果。在真实物理环境中反复试错能暴露这类问题就像真实物理世界的强化学习但试错速度慢、存在安全风险且难以并行。二、组合式世界模型原理将 “预测模块、价值评估模块相互独立、可各自专门研究” 的架构定义为组合式世界模型。这里所说的 “组合式” 是功能层面的定义即便预测、评估模块集成在同一个大系统内二者功能依然相互独立。采用组合式架构让两个模块可灵活调整、独立迭代优化。可见的涌现状态很重要。它可以让我们问错误是否来自于预测错误的结果还是来自于判断错误的价值模型 [ 模块分离带来一个关键优势故障溯源清晰我们可以直接定位错误来源于预测模块推演出错还是价值模块判断失误 ]。为什么要将预测、评估模块拆分开1二者优化目标、输出内容完全不同预测模块输出未来观测画面价值模块输出奖励、进度、优势值二者建模范式也存在巨大差异预测模块动力学建模高维画面生成价值模块建模任务条件下的价值优劣评估。监督和失效部分也一样。2两个模块会各自独立出错预测模块推演错误结果价值模块误判正确场景。可见的涌现状态很重要。它可以让我们问错误是否来自于预测错误的结果还是来自于判断错误的价值模型 [ 模块分离带来一个关键优势故障溯源清晰我们可以直接定位错误来源于预测模块推演出错还是价值模块判断失误 ]。3采用组合式架构让两个模块可灵活调整、独立迭代优化。如果融合为单一网络标签、模型能力、训练更新节奏会深度耦合优化灵活性大幅下降。三、四项研究工作简介3.1 四项工作的研究脉络研究演化路线World Model 与 Policy 的耦合越来越深ReSim → SFS → World Engine → RISE对应的研究脉络可以概括为World Model 从“帮策略选动作” → “在推理时修改动作” → “在训练时成为策略训练环境” → “成为机器人持续自我改进的学习环境”。ReSim使用危险非常规动作仿真数据集和真实数据集融合进行世界模型训练视频奖励模型进一步选择候选轨迹或策略结果使策略更安全。SFS 框架采用 “先生成、再修正” 流水线优化机器人操作任务引入显式优势评估器并行推演多条未来轨迹实现在决策完成之前价值评估能影响动作生成。前两项工作都是利用世界模型在inference time推理阶段推演优化单个独立策略。前两项工作都包含策略训练模块但世界模型仅作用于单次决策。后两项工作在training time进行策略训练优化策略。World Engine 找到 policy 的 failure → 把 failure 重建成可交互的3D world → 行为世界模型生成更多虚拟 variation → 直接作为策略迭代的RL训练环境RL post-training微调 → 策略优化。RISE把真实机器人 RL 的 environment 搬到 World Model 中在WM中虚拟推演经验并用来RL训练提升policy, 新的policy再在WM中进行虚拟推演经验来RL训练Policy形成online closed loop策略迭代优化。3.2 ReSim首先我们解决预测可靠性问题真实世界真实自动驾驶数据集视觉场景丰富但大部分动作来自人类驾驶员动作分布狭窄、故意的安全操作。所以道路运动的碰撞和其他非专业结果样本数据是极少的。因此只在这类数据上训练的世界模型可以忽略不寻常的提议动作并产生一个看起来正常的预测画面。我们给它一个不安全的轨迹或控制信号但世界模型不能相应地生成预测画面。所以第一项研究在这个场景中我们的关键思路是补充仿真数据补齐动作分布。正如左侧部分所示我们将CARLA仿真数据与来自 YouTube 和nuPlan真实世界数据集的数据进行融合从而补充和扩展动作空间的覆盖范围。真实世界数据集提供带轨迹标注的实景、多元常规路况仿真数据集补充各类激进、危险非常规动作我们可以从中计算奖励并一起训练模型。所以在左边部分我们将这些数据结合起来进行世界模型训练。正如右侧部分所示配套的视频奖励模型同样基于CARLA仿真数据训练但是它可以零样本适配真实路况。通过视频奖励模型我们可以进一步选择候选轨迹或策略结果使策略更安全或其他想要的结果。3.3 SFS基于这项成果我们进一步提出新研究问题在决策完成之前价值评估能影响动作生成吗 [ 价值评估能否在动作生成完成前提前干预、修正推演过程 ]第二项研究采用 “先生成、再修正” 流水线优化机器人操作任务。我们提出 SFS 框架引入显式优势评估器并行推演多条未来轨迹大幅提升模型效率。整套流程策略基于左侧部分的当前观测图像和目标图像生成初始动作序列轻量化两层触发器判断动作是否需要修正无需修正则直接输出需要修正时触发反思扩散模型使用多束搜索生成多条备选未来轨迹轻量化价值评价器计算每条轨迹的优势值择优保留最优轨迹。3.4 World Engine由此引出更深一层研究问题能否把世界模型生成的虚拟经验直接作为策略迭代的训练环境这个方案风险更高预测、价值评估的误差不再只影响单次决策而是融入训练分布并可以塑造未来的行为。第三项研究World Engine 聚焦长尾路况我们基于3D高斯泼溅 (3DGS Gaussian Splatting) 将每个场景重建为照片级逼真的可交互仿真环境。这个世界模型就是一个行为世界模型如左下角展示那样。行为世界模型是面向多智能体结构化轨迹的扩散模型。我们可以设定红色目标点结合地图拓扑和规划好的自车轨迹生成周边车辆或交通的海量多样化未来运动轨迹。行为模型预测所有交通参与者运动轨迹3DGS 仿真器渲染对应相机、雷达传感器观测画面。它们从一段真实记录的路测片段生成成千上万条闭环交互样本用于强化学习后训练微调。因此在我们生成了多样的数据特别是一些长尾案例之后我们用强化学习训练基础自动驾驶策略大幅提升极端场景行驶安全性。整套流水线长尾事件任务完成率极高相比不生成多样虚拟轨迹、仅用真实数据闭环训练的基线模型经过长尾路况样本闭环后训练微调后整套流水线成功率提升十几个百分点。3.5 RISE真实世界强化学习交互试错速度慢、每次实验需要人工重置场景、全程安全监控硬件损耗成本极高。第四项研究在机器人操作领域我们推出 RISE 框架结合重建仿真场景打造虚拟强化学习训练环境完成策略迭代优化。该模型同时学习机器人未来视觉观测和虚拟场景里推演轨迹的价值。RISE 保留少量真实机器人示范数据和策略推演作为底层锚点但将绝大多数候选交互转移至虚拟世界推演少量真实物理经验保证模型贴合物理现实海量虚拟推演极大扩充专项策略训练数量。RISE 世界模型是典型的组合式架构包含两个独立专业化模块动力学模型接收最近的多视角观测 未来机器人连续动作块预测对应的多视角未来画面价值模型接收推演画面与任务文本指令评估任务完成进度。不同动作块的价值差值直接作为强化学习的奖励与优势函数用于策略优化。模块拆分的核心价值是二者归纳偏置完全不同动力学视频生成模型优先保证画面视觉连贯、动作可控价值模块专注识别任务进度、局部操作失败二者优化目标互不冲突。整套世界模型仅在训练阶段启用机器人实际部署推理时完全无需加载世界模型不存在额外算力开销。动力学模型基于轻量化 Genie Envisioner GE-base初始化相比一些强大的世界模型动力学模型算力效率极高两秒即可生成 25 帧画面我们额外加入 Agibot World和Galaxea机器人数据集强化动作可控性训练采用文本导向批采样每个批次聚焦同类任务下不同动作避免算力浪费在无关视觉场景让模型更容易学习动作差异带来的环境变化。推理速度至关重要因为想象在rollout循环中。这基本上是下一步的策略强化学习。但所有算力开销仅产生于训练阶段部署无负担。价值模型基于 PI0.5 初始化该预训练模型已学习大量多视角、语言条件和机器人先验知识。训练损失融合两项目标进度回归损失、时序差分TD损失。进度回归损失保证价值打分曲线平滑即便操作轻微偏离最优路径模型依然保持正向预期时序差分损失重点放大失败样本的惩罚权重确实能快速识别各类操作失误。两项损失结合模型输出的轨迹价值打分曲线既平滑稳定又能精准捕捉失败行为。左侧图表直观解释模块专业化拆分的必要性仅用时序差分损失的价值曲线波动剧烈仅用进度回归损失价值曲线平滑稳定。综上动力学模块专注生成可控未来画面价值模块依托推演画面完成信用分配模块接口完全透明一旦策略优化效果不佳我们可直接定位问题来源是动力学推演未来画面失真还是价值打分判断出错。把这些部分结合在一起我们就实现了系统性能提升。整套训练循环逻辑以真实观测为起点策略提出高优势预期的动作块动力学模型推演动作对应的未来画面价值模块评估状态转移优劣。推演生成的虚拟三元组观测、动作、价值和真实离线经验样本一起进入缓冲区 [ 一同存入经验回放池]。行为策略基于回放池样本训练学习在对应价值优势条件下输出最优动作更新后的VLA权重同步至推演策略。为解决世界模型幻觉问题一个想象的观测可能会看到一个额外的推演。我们不会设置过长推演时序循环可并行执行训练数据大量混合真实样本保证虚拟推演贴合物理现实。四、总结展望简单总结本次分享核心组合式架构可让预测、价值评估模块独立专业化优化使用不同规模数据集分别训练在采信虚拟经验的价值打分前可提前校验推演画面经验可靠性。未来三大核心研究方向第一完善底层基础设施提升模型训练、推理、强化学习RL交互虚拟环境的算力效率第二提升泛化能力研发跨任务通用价值模型第三探索一体化大世界模型稍后马克斯会分享英伟达 Cosmos 3。一体化融合的核心难点是在整合模块的同时不能丢失原有分拆架构的专业化优势与故障溯源透明性 —— 这正是组合式模型能发挥价值的根本。五、QA1 RISE任务特定的进度价值模型如何泛化到未见过的任务而基本不需要再训练基本上价值评估模型是特定于任务的。我们收集了一些真实世界的数据我们基本上在PI05上微调得到价值模型它是针对特定任务的。2 那么RISE价值模型在场景数据点上的可靠性如何呢那么基本上它是如何偏离场景数据的对于任务它不能泛化但是对于领域内的泛化比如光线位置和其他一些典型的泛化实验泛化能力可以和策略模型的能力相似。它们来自相同的骨干PI05和相同的数据但是使用TD损失。