ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Robo-ValueRL——面向离线到在线RL的可靠价值估计:同时捕捉全局任务进度和局部动作偏好,先离线预训练,后在线提升(即在线残差策略自适应)

Robo-ValueRL——面向离线到在线RL的可靠价值估计:同时捕捉全局任务进度和局部动作偏好,先离线预训练,后在线提升(即在线残差策略自适应) 前言如原论文Robo-ValueRL所说离线到在线的RL在实现具有良好泛化能力的机器人操作方面前景广阔但其端到端系统的高度复杂性使复现与诊断变得困难。在这类系统中价值估计在对异质数据进行优先级排序以提升策略时起着核心作用尽管价值估计十分关键但一个核心问题仍然缺乏深入研究在离线到在线的强化学习中价值函数的可靠性是如何塑造策略优化过程的为回答这一问题作者提出 Robo-ValueRL一个统一框架用于实现可靠的价值估计并系统性地追踪其对策略预训练与在线提升的下游影响具体而言Robo-ValueRL 学习一个历史条件的价值估计器并通过全局进展global-progress和局部偏好local-preference指标来评估其可靠性由此产生的价值估计会被传播到质量条件的一致性策略预训练中以及在线rollouts 上的一个残差自适应模块中从而提供一个统一的测试平台用于分析价值可靠性如何塑造下游策略性能在覆盖 240 小时离线示教数据和超过 3,000 条在线 rollout 轨迹的广泛实验中作者发现下游性能与价值可靠性之间存在强关联可靠的价值函数能够提供更优的动作质量估计使得价值引导的离线强化学习相比于质量无关的行为克隆具有更好的扩展性并且通过优先使用高质量 rollout 数据来稳定在线提升第一部分 Robo-ValueRL: Reliable Value Estimation forOffline-to-Online Reinforcement Learning1.1 引言、相关工作1.1.1 引言如原论文所述离线到在线强化学习offline-to-online reinforcement learning已成为实现具有良好泛化能力的机器人操作的一种颇具前景的范式 [1–3]它将离线策略预训练 [4–11] 与通过真实世界交互进行的在线性能提升 [12–17] 有机衔接然而与传统基准任务不同这一范式构成了一个端到端的具身学习系统其性能由多个紧密耦合的组件共同决定包括数据整理、价值估计、离线预训练以及在线探索[18–20]。这些相互依赖关系使得性能难以复现并且在真实部署条件下一旦失败往往难以及时定位和诊断在这些因素之中价值估计在离线到在线的机器人强化学习中处于核心地位 [21,22]。其作用在于评估异质性的经验数据——从次优示范到在线 rollout——并决定这些数据将如何促进策略的改进[23–25]可靠的价值估计可以优先利用信息量更高的经验并抑制低质量数据而不准确的价值估计则可能错误排序经验并使学习过程不稳定然而现有关于价值估计可靠性的证据仍然零散地分布在整个离线到在线流程中 [3,23,26,27]算法研究往往只在孤立的环境下分析价值优化问题 [2,3]而机器人系统研究则主要报道下游性能却很少检验所学习到的价值是否真实反映了任务进展或动作质量[23,26,28]。因此价值估计可靠性在离线预训练和在线改进中的作用仍有待系统性研究为研究这一作用作者从两个相互耦合的视角考察价值估计的可靠性一是如何从异构的机器人数据中学习到可靠的价值二是这种价值的可靠性如何在离线预训练与在线改进两个阶段影响策略学习为使这一研究具备具体落地的载体来自1中国人民大学高瓴人工智能学院2北京仿人机器人创新中心3北京林业大学4北京大学5微软研究院的研究者提出 Robo-ValueRL这是一个统一的、从离线到在线的机器人强化学习框架将“可靠价值函数学习”、“价值引导的离线策略预训练”和“真实世界中的在线改进”组织成一个连贯的流程。除最终成功率之外Robo-ValueRL 还引入了价值可靠性指标为将价值质量与下游策略优化联系起来提供了分析依据其paper地址为Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning其项目地址为gewu-lab.github.io/Robo-ValueRL其GitHub地址为github.com/Open-X-Humanoid/Robo-ValueRL具体而言Robo-ValueRL 首先在离线机器人数据上训练一个以历史为条件的价值估计器以缓解由部分可观测性和视觉遮挡带来的歧义其对动作质量的估计被用于为离线经验打分以进行质量条件的一致性策略预训练 [29]从而通过一步去噪实现高效的价值引导动作生成随后将预训练好的策略部署到真实环境中收集带有人类在环干预的 rolloutRobo-ValueRL进一步在这些 rollout 上更新价值估计器并从中筛选出高质量的在线片段用于训练一个轻量级的残差自适应模块从而在保留先验知识的同时有针对性地修正失败模式在这一离线到在线的全过程中作者的度量指标从全局任务层面的推进情况来评估价值的可靠性以衡量这些数值是否体现了长时间尺度上的任务推进情况以及局部动作层面的偏好从而评估这些数值能否刻画细粒度的动作质量如下图所示Robo-ValueRL 通过可靠的价值引导改进离线到在线的强化学习a) 使用可靠性度量对价值函数进行评估以用于后续策略学习b) 可靠的价值使得能够从混合质量的演示数据中进行可扩展的离线预训练c) 基于价值引导的在线自适应稳定了策略改进过程使毫米级芯片插入力成功率达到 86%综合来看Robo-ValueRL 提供了一个统一的测试平台用于分析价值估计的可靠性如何影响离线扩展能力与在线性能提升1.1.2 相关工作首先对于从异构机器人数据中学习在扩展机器人学习规模时一个核心挑战在于真实机器人数据的异质性[30,31]人类示教中包含错误、犹豫以及局部次优的动作而在线 rollouts 又会引入探索性失败和不稳定交互[20,28]当前大规模 VLA 流水线通常通过行为克隆来吸收这类混合质量的数据这种方式能够提供广泛的行为先验但缺乏对动作质量的显式区分能力[8,32,33]因此不区分质量的模仿学习可能同时拟合有效片段和次优片段离线强化学习以及近期的离线到在线方法通过使用价值函数从离线数据和在线rollouts 中挖掘更高质量的行为从而缓解这一局限[3,23,26,34,35]然而现有工作主要通过最终策略性能来评估异质数据的利用效果对于价值估计本身的可靠性以及这种可靠性如何影响后续学习仍不清晰作者通过将价值估计视为异质机器人数据与策略学习之间的接口来弥补这一空白使混合质量的轨迹能够被纳入策略优化过程其次对于离线到在线强化学习离线到在线强化学习将离线强化学习的高样本效率与在线交互的适应性相结合 [1,36]其中一个关键挑战是分布偏移一旦部署基于离线数据训练得到的策略可能会访问在数据中覆盖不足的状态与动作从而导致价值评估网络critic失准以及在线更新过程的不稳定 [37,38]现有方法通常通过在离线策略周围约束在线自适应范围并在离线数据与在线数据的使用之间进行平衡在安全适应的同时保留有用的先验 [3,22]以缓解这一问题然而这些研究多在小规模基准上进行评估。近期基于 VLA 的机器人系统 [23,26,28] 将离线到在线学习扩展到大规模通用策略但主要汇报最终性能对价值估计的稳定性及其设计依赖性缺乏深入探究在本文中作者构建了 Robo-ValueRL 框架以系统性研究价值估计如何影响离线策略预训练和在线性能提升并探讨能否在下游策略学习之前诊断价值函数的可靠性最后对于机器人操作中的价值估计价值估计在机器人操作中处于核心地位其中评论器critic为策略改进提供长时域信号。从时序差分学习与线性近似到用于视觉控制的深度强化学习[25,39–44]价值函数传统上都作为与策略耦合的评论器进行学习近期工作则转而训练通用价值函数在不同目标、任务和数据集上评估任务进展与行为质量[45–48]其中基于目标的价值函数、successor representations 以及 world-value models 进一步提升了价值预测的可迁移性[27,49–51]然而评估方法尚未跟上现有度量如 GVL 中的 Value-Order Correlation 以及VIP 中的平滑性主要衡量最优轨迹[27,48]而同时期的工作虽然研究了多样的次优价值估计却主要通过带过滤的行为克隆进行验证[51]相比之下作者训练了一个基于历史条件的信息进行估计的价值函数并提出全局任务层面的进度度量与局部动作层面的偏好度量用于评估其在离线到在线学习全过程中的作用1.2 Robo-ValueRL作者提出了 Robo-ValueRL这是一个以可靠价值估计为核心、从离线到在线一体化的机器人强化学习框架Robo-ValueRL 首先训练一个基于历史条件的价值估计器从视觉观测和历史信息中推断归一化的任务进度并利用价值差分来构造动作质量指示信号用于质量条件的 VLA 一致性策略预训练在在线改进阶段作者冻结预训练策略仅基于真实环境交互数据学习一个轻量级残差适配器从而在保持离线先验的同时实现有针对性的适应且作者进一步引入价值可靠性度量用于评估全局的任务阶段排序以及局部的动作级偏好从而将价值质量与离线扩展性和在线策略改进关联起来1.2.1 历史条件化价值估计器在长时域机器人操作任务中单帧价值估计本质上是含糊不清的因为遮挡和重复的视觉模式会导致不同任务阶段在视觉上看起来相似为了解决这一问题作者提出了一种历史条件化的价值估计器它将当前的视觉观测与过去观测的紧凑表示进行融合从而实现更可靠的价值预测具体实现细节见附录 C.1价值估计器使用一个带有轻量级Transformer 价值头的PaliGemma 视觉-语言骨干网络[52]在时间步当前的三视角观测和语言指令由PaliGemma 处理以生成一个视觉-语言条件上下文其作为后续价值估计的VLM 生成前缀表示进一步地视觉历史通过一个SigLIP 编码器[53] 进行编码并使用轻量级Perceiver 模块[54] 被汇总为紧凑的token为了预测任务价值作者将一个可学习的价值查询附加到上并采用一个以为条件的基于transformer 的价值头该网络在K 个离散化价值区间上输出一个类别分布首先是训练方法作者使用归一化的进度值来监督估计器作者采用HL-Gaussian 分布表示[26, 55]目标被投影到分箱上作为一个软分布数值头通过交叉熵损失进行优化在推理过程中最终的标量值估计被解码为对各个区间的期望其次对于动作质量指示器价值估计器提供稠密的动作质量指示用于指导离线强化学习和在线微调直观地说如果一个动作能够提升估计的任务进度则认为该动作是有益的形式上对于从到的转移作者将价值提升计算为然后作者通过使用预先定义的正、负边界和对进行阈值分割来分配离散的动作质量指示器分别表示低质量、中性和高质量动作1.2.2 质量条件化的视觉-语言-动作模型给定从离线经验中估计得到的动作质量指标作者在异质示范上训练一个以质量为条件的VLA 模型πθ并配备一个一致性策略头。该策略学习将动作模式与估计的质量关联起来从而将高质量行为与次优片段区分开来在推理过程中期望的质量提示引导策略朝向高质量的动作生成而一致性头则实现一步去噪以支持高效的实时控制。更多实现细节见附录C.2具体来说质量条件VLA 模型πθ 使用PaliGemma 作为视觉-语言骨干网络并采用一致性策略头作为动作专家对于质量这个条件在时间步为了将基于价值的质量信息注入到语言条件策略中作者首先将动作质量指示器转换为文本形式的动作质量提示并将其与任务指令拼接以形成进一步地VLM 模型将多视角观测和质量条件的语言输入作为输入生成用于动作生成的视觉-语言上下文为了实现高效的动作生成作者将动作专家实例化为一致性策略[29]。在条件为VLM 生成的动作上下文和机器人状态的情况下该策略将噪声动作块噪声级别为直接映射到对应的干净动作块在推理过程中作者从中采样并通过单次去噪步骤获得最终动作从而实现低延迟的实时机器人执行进一步而言对于训练方案。质量条件的VLA 模型πθ 通过联合目标进行优化该目标结合了动作重建和相邻噪声自一致性给定真实动作片段作者从Karras 噪声调度中采样一个噪声水平来构造带噪声的动作片段其中模型首先通过动作重建损失进行监督进一步在相邻噪声水平和之间施加自洽性以在去噪轨迹上对齐干净动作预测在处的预测通过一步求解器传播到从而得到一致性损失其中是一个与噪声相关的加权项表示停止梯度操作而通过对在线模型进行指数滑动平均来更新这种一致性正则化鼓励完整的VLA 模型在相邻噪声水平上产生稳定的干净动作预测使得学习到的策略在推理时能够用单步去噪近似多步去噪最终的联合训练目标由超参数λ cons 进行平衡1.2.3 在线残差策略自适应在线rollouts 为策略改进提供了有价值的交互数据但直接在异构rollouts 上微调预训练的VLA 策略会破坏优化稳定性并导致对先验已学行为的灾难性遗忘因此作者冻结离线训练的基础策略并引入一个轻量级的残差适配器它预测对基础动作的有界修正从而在保留预训练先验的同时利用在线经验实现有针对性的适应。更多的结构和训练细节见附录C.3给定来自冻结基础策略的动作片段残差适配器预测一个有界校正以对其进行细化具体而言适配器将VLA动作上下文压缩为紧凑的潜在上下文token使用一个Perceiver 模块[54]将它们与机器人状态st 和基础动作预测拼接起来并将结果输入到一个轻量级Transformer 中以预测一个不受约束的残差和一个逐步门控logit其中将残差约束为并使用sigmoid 函数约束门控为最终自适应得到的动作块计算为进一步对于训练步骤而言仅使用离线示范和在线rollouts的混合来训练残差adapter同时保持基础VLA 策略冻结首先使用学到的价值估计器根据估计的动作质量指示器将在线rollouts 划分为高质量样本和低质量样本对于来自的高质量在线样本校正损失鼓励自适应动作朝向成功的在线行为移动为方便大家更好的理解我用一个表格 帮大家总结下符号出处含义§3.2 Training Recipeground-truth action chunk离线演示中的真实动作块§3.3冻结基座策略预测的动作块式 (7)适配后动作块无 hat、无下标 0合理推断xt​ 指的是高质量在线 rolloutDon​ 中实际执行并记录下来的动作块因为后文紧接着说该损失encourages the adapted action to move towardsuccessful online behaviors——即让适配动作逼近那些被价值估计器判定为高质量的在线轨迹里实际执行的动作这里有两个值得注意的疑点符号不一致§3.2 中 ground-truth chunk 用 x0​ 对应 consistency policy 的去噪记号到 §3.3 突然换成 xt​ 二者指代的应是同类对象真实动作块作者没有交代记号切换监督目标的真值性质存疑在线 rollout 的动作是策略自己执行出来的并非人工示范真值用筛出高质量样本后对其做 BC本质上是对成功在线行为的自蒸馏/加权行为克隆论文 §6p16也承认存在 learning corrections from low-quality sampleswithout ground-truth corrected actions 的问题对于来自的离线样本行为保持损失使自适应动作保持接近冻结的基础动作防止残差adapter 偏离预训练行为先验且进一步引入门控损失来调节何时应激活残差校正最终的adapter 目标为1.2.4 价值-可靠性度量指标为了系统地诊断价值函数的可靠性作者建立了一套评估协议从全局任务层面的进展和局部动作层面的偏好两个维度全面评估已学习的价值函数给定一个预测价值序列该评估套件可以检验模型在判断任务推进、识别高质量动作以及检测执行错误方面的能力首先对于全局任务级进度该诊断衡量价值函数是否保留了任务进度的粗略排序。给定子目标边界时间步提取每个区间的中点为由于后面的区间对应于更高级的任务阶段一个可靠的价值函数应当为后面的子目标分配更高的值即作者将中点排序率Midpoint Ordering Rate,MOR定义为满足该排序关系的相邻子目标转移所占的比例其次对于局部动作层面的偏好该诊断用于评估价值函数在局部轨迹上的动作层估计是否稳定且准确。一个可靠的价值函数在任务成功执行期间应当保持平滑、连续的估计同时对偏离稳定任务进展的异常行为给予显著的惩罚。作者使用两个互为补充的度量指标来刻画这种行为流畅性在成功的执行路径上预测的数值序列应当平滑上升而突然向下的跳变则表明数值估计存在噪声或不稳定为了量化这种局部流畅性作者评估这些时间振荡的频率和严重程度[27]具体而言作者将Bump Ratio 定义为用于度量预期的上升趋势被超过一个小的噪声容忍阈值ϵv 所违背的频率同时计算Bump Magnitude 为以刻画这些向下跌落的平均幅度从而量化价值信号的整体稳定性时间误差辨别流畅性度量的是在成功执行过程中的稳定性而时间误差辨别则评估价值函数是否能够可靠地惩罚偏离正常任务进度的行为从而防止错误行为被赋予过于乐观的动作质量估计对于每一段标注的错误片段E作者从错误发生前的价值轨迹构造一个正常进度参考表示在任务不被打断的情况下所期望的价值然后将这一参考与平滑后的预测进行比较并将价值缺口定义为其中意味着在正常进度下的预期之上估计器给出了更低的价值报告误差敏感度以衡量价值缺口的峰值并报告误差斜率以衡量该缺口在错误执行过程中是否得以持续1.3 实验在本研究中作者探究如何从异质机器人数据中学习到可靠的价值函数以及价值函数的可靠性如何在离线预训练和在线改进过程中影响策略学习作者在两个具有挑战性的真实世界操作任务上评估 Robo-ValueRL这些任务包含 240 小时的异质离线示范数据和超过 3,000 条在线 rollout 轨迹如图 3 所示a芯片插入一个长时序、细粒度的任务机器人需要抓取一块PCB将其调整到一个可行姿态然后将芯片插入到PCB底板下方凹槽内、毫米级尺寸的插槽中如红色圆圈所示b方块拆解机器人拆解随机摆放的方块并将其根据颜色匹配放置到布局随机的对应颜色托盘上该任务需要具有可泛化的双臂协作能力如此既涵盖了既需要高精度的细粒度操作又要求具备可泛化的双臂协作能力如原论文所述在这一实验设定的基础上作者围绕三个逐步递进且相互关联的问题展开研究1) 如何对价值可靠性进行诊断在下文第 1.3.1 节中作者评估价值可靠性度量并考察它们与下游策略成功之间的一致性2) 价值可靠性如何影响离线预训练在下文第 1.3.2 节中作者在不同数据规模和质量阈值下比较基于价值引导的预训练展示高可靠性的价值如何提升从异质示范中学习的效果3) 价值的可靠性如何影响在线改进在下文第 1.3.3 节中作者研究了结合价值引导的 rollout 过滤的迭代式在线自适应过程表明可靠的价值评估能够稳定基于真实世界交互的策略改进最后在下文第 1.3.4 节中作者给出了与定量结果相辅相成的定性证据表明机器人通过Robo-ValueRL 线上线下结合强化学习框架学会了高效的执行方式以及自主的自我纠错模式// 待更
返回列表