行业资讯
Harness VLA:利用记忆引导智体将冻结 VLA 转化为可靠的操作原语
26年7月来自清华、Striding AI公司、普渡、中科院自动化所、无问芯穹公司、港科大和中关村学院的论文“Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents”。基于语言指令的操作任务既需要精确且涉及丰富接触交互的控制能力也需要针对语言、场景及长程任务序列的鲁棒推理能力。端到端视觉-语言-动作VLA模型虽具备强大的局部视觉运动控制技能但其训练依赖于特定分布的任务轨迹在面对语义重定向、目标重绑定、空间布局偏移及局部接触不稳定等部署扰动时性能往往会显著下降。大语言模型LLM驱动的智体虽能提供互补的语义与组合推理能力但纯粹基于解析式方法的原语在处理不规则抓取、受限放置及与铰接体交互等任务时往往力不从心。为此提出 Harness VLA 这一记忆增强型智体框架该框架将冻结参数的 VLA 视为一种可重试的、支持丰富接触交互的原语并将其与一组小型固定解析式原语涵盖语义定位、预备动作、搬运、导航及释放等功能进行组合。Harness VLA 并不盲目扩充技能库而是通过学习特定任务的执行轨迹、全局成功规则及失败模型来掌握这些固定原语的适用操作范围。通过将语义重定位、非接触式执行及 VLA 预备动作调整等任务交由规划器处理同时仅在涉及丰富接触交互的局部阶段调用冻结参数的 VLAHarness VLA 实现在无需微调的情况下将预训练 VLA 的应用范围扩展至原始轨迹分布之外。在桌面操作、家庭厨房场景及从整洁到随机布局的双臂操作等受扰动测试中Harness VLA 表现优异在 LIBERO-Pro 和 RoboCasa365 基准测试中其性能较最强基线分别提升 38.6 和 25.4 个百分点在 RoboTwin C2R 测试中成功率达到 58.4%。如图 1所示Harness VLA 概述基于程序与工具使用的机器人智体“代码即策略”Code-as-policies类系统将机器人控制重新定义为程序合成问题模型编写可执行程序来协调感知与运动API既利用大语言模型LLM的组合泛化能力又保持底层控制的确定性。继 Code-as-Policies [8]、ProgPrompt [9]、Instruct2Act [60] 和 ChatGPT-for-Robotics [61] 之后这一范式已扩展至多模态程序合成如 RoboCodeX [62]、ViperGPT [63]、VisProg [10]、3D价值图生成 [64]、VLM监督下的装配任务 [65] 以及长程智体框架 [11, 66]。Harness VLA同样致力于通过显式的感知与控制接口将语言模型的推理转化为可执行操作但在动作表示上有所不同智体规划器并不合成可执行代码或新的控制程序。相反它在一个闭环“驾驭”harness内输出结构化的 JSON 原语调用在每个原语执行后观察结果并根据当前的 RGB-D 观测数据和记忆信息重新绑定下一个原语的参数。近期研究还探讨智体如何构建可复用的技能库例如ASPIRE [67] 利用细粒度的执行轨迹来诊断故障并合成经由验证的修复方案进而将由此产生的定位、导航、运动、抓取及调试模式纳入不断扩展的技能库中。这一研究方向与本文工作互补ASPIRE 侧重于扩展智体的可复用技能而 Harness VLA 则有意保持原语词汇表固定不变重点研究如何利用记忆引导的组合方式在无需于部署阶段扩展原语的前提下对固定的 VLA 模型进行功能扩展。另一类相关研究借鉴软件工程领域的智体技术经验表明可执行代码是 LLM 智体的一种强有力的动作表示形式 [14]而 SWE-agent [15] 和 OpenHands [16] 等系统则针对迭代式编辑、执行与反馈流程建立规范化的控制框架。借鉴其中的框架原则——即结构化接口、持久化状态、执行反馈及记忆机制——但并未沿用“必须将动作表示为代码”这一特定要求。通过自校正机制 [68–70] 和跨步骤保持的持久化符号状态 [71]系统的可靠性得到进一步提升与此同时基于大语言模型LLM的规划器 [72–79] 也展示 LLM 能够编排预训练的原语或模块、将指令映射至 3D 场景并从失败中恢复的能力。然而现有文献中反复出现两个局限性。首先针对特定任务的执行轨迹很少被转化为可复用的参数化记忆从而无法在新的空间布局下重新应用。其次关于失败的经验教训很少被提炼并存入“全局记忆”Global Memory中导致规划器无法避免重复出现已知的无效抓取、虚假成功或不稳定的过渡动作选择。Voyager [18] 的研究表明持久化记忆能提升数字沙盒中具身智体的性能但这种以记忆为中心的设计尚未与支持物理操作、且具备丰富接触交互能力的 VLA原语相结合。本文框架将两者进行有机结合利用冻结参数的 VLA 作为处理复杂接触交互的专家模块并通过统一的原语接口进行调用成功的原语序列被存储在“任务特定记忆”中而可复用的成功规则与失败模型则被提炼并存入“全局记忆”中。这两项设计决策——即利用 VLA 处理接触密集型操作并对其他任务采用记忆增强的原语组合方式——使得单一的、由记忆驱动的智能规划器能够应对特定环境下的全套任务分布。这其中包括各种改写表述或重新指定目标的自然语言指令而这些指令往往能难倒那些语言处理能力仅具雏形即语言通道功能退化的端到端 VLA 模型 [2, 4]。机器人操作领域的一个长期目标是构建一个能够可靠执行自由形式自然语言指令的系统以适应不断变化的物体、布局和机器人形态。目前两种主流范式正从截然不同的方向向这一目标迈进。端到端视觉-语言-动作VLA模型直接从机器人轨迹中学习涉及丰富接触交互的视觉运动控制而基于大语言模型LLM的编程智体则利用语言模型的推理能力组合显式的感知与控制 API。这两种范式各具优势但也都在不恰当的组件上赋予过重的负担整体式 VLA 必须在单一策略内同时处理语言语义落地grounding、长程任务组合及底层控制而编程智体则不得不通过人工设计或智体生成的 API 来实现物理上精细的交互操作。如图 2 展示解决方案利用解析式原语analytic primitives来应对部署时的环境扰动仅在局部接触密集区域即 VLA 训练分布具有高信息量的区域调用 VLA。端到端 VLA 模型发展迅速已从通用的机器人策略 [1, 2] 演进为流匹配flow-matching和动作推理架构 [3–6]。其优势在于处理局部的、基于图像输入的接触任务例如抓取不规则物体、高精度放置或操作那些对解析式控制器而言过于脆弱的机械装置。其局限性在于难以应对超出训练轨迹分布的部署场景。一个在特定任务轨迹分布上训练出的模型虽能掌握抓取牛奶盒或转动水龙头的技能但在语义目标变更、目标谓词重定义、物体布局改变或需将短时技能组合成更长程的操作序列时往往会失效。在这些部署扰动下即便指令或场景关联已发生变化策略仍可能重复训练期间熟悉的行为 [2, 4, 7]此外单次不稳定的接触失败也可能导致整个整体式执行过程彻底失败。基于 LLM 的编程智体及其驾驭harness提供互补的语义理解与组合推理能力。诸如“Code as PoliciesCaP”和“ProgPrompt”之类的系统利用精选的感知与控制 API 组合生成可执行程序 [8, 9]而近期的多模态或智体变体则进一步扩展这一理念引入更丰富的感知能力、工具使用、反馈机制以及持久化的执行状态 [10–13]。从更广泛的角度来看“编码智体驾驭”coding-agent harness将模型输出封装在一个包含工具接口、记忆机制、验证器、执行循环及反馈通道的结构化运行时环境中这使得智体能够修正决策、将成功的操作轨迹或失败诊断写入记忆并在统一的控制界面下协调各种异构工具 [14–17]。然而在机器人操作领域扩展此类系统往往意味着扩充“原语”primitive或技能库相比之下纯粹的解析式原语——例如逆运动学IK移动、手腕旋转、基座运动、夹爪开合与释放等确定性运动学或基于模型的控制器——往往难以应对不规则抓取、受限放置以及关节物体操作等复杂场景。Harness VLA 将这种编码智体框架的理念应用于机器人操作保持原语库规模小且固定让智体学习如何协调这些原语。规划器负责组合解析式原语以处理非接触式结构化动作如目标定位grounding、自由空间移动、姿态调整、移动至预备位、失败后的重定位以及释放动作。对于接触密集的阶段规划器则通过一个经学习得到的原语——VLA ACT——来调用冻结的 VLA 模型。这种方式将 VLA 从单一的轨迹策略转变为可复用的“接触操作专家”使其能够胜任超出原始轨迹分布的任务且无需进行微调或在部署阶段扩展原语库。关键不仅在于提供 VLA ACT 这一接口更在于学习何时以及如何使用它。Harness VLA 将 VLA 的执行视为一种可重试的局部尝试规划器可将机器人调整至有利的局部观测位姿调用 VLA检查接触结果并在必要时重新调整位姿。智体框架内部的两个记忆模块支持这一过程 [14, 15, 18]特定任务轨迹task-specific traces存储成功的原语组合用于少样本few-shot下的重定位全局记忆global memory则存储可复用的成功规则与失败模型。该框架并非单纯增加技能而是让规划器掌握每个固定原语的适用范围明确哪些子问题应采用解析式方法处理何时适合使用 VLA ACT以及在接触尝试失败后应如何重新调整位姿。用于语言条件化操作任务的智体框架遵循图1所示的系统架构。任务描述、RGB-D观测数据和机器人状态被输入到智体规划器中该规划器基于固定的基元库进行推理并从“任务特定记忆”与“全局记忆”中检索上下文信息。智体驾驭通过JSON序列化的基元接口将规划器与仿真器连接起来驱动基于回合的执行循环并将成功的探索轨迹写入“任务特定记忆”同时将泛化的启发式策略存入“全局记忆”。基元库primitive lib定义规划器允许调用的唯一操作包括一组少量的解析型基元以及一个结构特殊的VLA基元——后者封装用于高接触交互的预训练视觉运动策略。1 任务设置和智体执行环任务设置。考虑在由刚体物理引擎例如通过 Robosuite 实现的 MuJoCo驱动的环境 E 中进行语言条件化的机器人操作。在每个时间步 t环境会暴露一个多模态观测元组 o_t (Irgb_t,Id_t,q_t)其中包含一个智体视角的 RGB 图像 Irgb_t、一个共轴对齐的度量深度图 Id_t 以及一个机器人本体感受状态 q_t末端执行器姿态和夹爪状态的连接。任务由自然语言描述 l 和一个二元补全谓词 G 定义G 仅在回合结束时作为稀疏成功信号暴露。智体执行循环。如图 1 中的展开条所示任务展开被构建为高级智体规划器 Π 和底层物理引擎之间基于回合的自回归交互。没有将视觉运动策略视为一个独立的层级而是将所有底层控制机制包括冻结的预训练视觉运动学习算法 f_θ 和所有确定性操作空间控制器统一到一个预定义的原始库 P 中。在每个执行回合 t规划器 Π 处理当前的多模态观测值 o_t、任务描述 l 以及从任务特定记忆和全局记忆中检索到的上下文信息。作为唯一的认知协调器Π 会针对选定的原始库 c_t ∈ P 发出一个结构化的 JSON 调用。物理引擎直接接收此调用并在模拟器中执行相应的物理运动直到满足原始库的内部后置条件。原始库执行完毕后引擎会输出后续观测值 o_t1 和更新后的机器人状态 q_t1。这个环境规划器循环会持续迭代直到目标谓词 G 得到满足或达到最大步数预算为止。2 Harness VLA 架构受近期“编码智体”coding agents的启发——这类智体通过“驾驭执行-反馈环”将模型决策转化为可执行操作 [14–16]——Harness VLA 采用类似的 REPL 风格形式来封装机器人操作。该 驾驭Harness充当规划器与环境之间的运行时契约它负责公开原语primitive方案、将决策序列化为 JSON 指令、执行原语、更新 RGB-D 及本体感知proprioception观测数据、记录执行轨迹、检索任务特定记忆与全局记忆、强制执行重置与资源预算策略并通过基准测试谓词 [17] 检查任务进度。由于该驾驭Harness将所有细粒度执行任务委托给原语库智体规划器 Π 得以从繁琐细节中解脱专注于组合推理。为此它高度依赖多模态观测通道RGB 图像支持定性的场景推理如杂乱程度、语义类别而对齐的深度图与本体感知数据则提供用于精确定位的度量空间信息。将该 Harness 框架下的智体生命周期划分为两个截然不同的阶段探索性引导阶段exploratory bootstrapping phase和严格的部署评估阶段。探索性引导阶段。智体基于任务的单个参考实例自主与环境交互以寻找可行的解决方案。在此阶段规划器 Π 拥有独占的 RESET原语调用权限并享有宽松的实际运行时间wall-clock预算。由于原语词汇表是固定的探索过程完全聚焦于迭代组合即寻找学习型 VLA 原语与确定性解析原语analytic primitives的最优编排方式。规划器 Π 反复尝试不同的操作阶段顺序、接触前位姿、VLA ACT 调用时机以及提前终止阈值。它观察每次原语调用的物理效应并在失败时进行策略修正。任务成功完成后智体将其经验系统地抽象并存入图 1 所示的两个记忆模块中。首先经由验证的原语调用序列被序列化为 JSONL 格式。该文件明确记录成功的逐步原语调用过程并通过将具体的空间坐标替换为符号化感知查询来进行参数化处理从而确保该序列在不同空间布局下均可复用。这种参数化的 JSONL 轨迹被存储在“任务特定记忆”中作为后续泛化测试的结构化先验信息。其次智体从探索过程中提取通用的启发式规则并将其存入持久化的“全局记忆”Global Memory中。这一共享存储库明确汇总各类成功规则例如能够充分利用完整任务指令的最优提示prompting策略同时它也记录关键的失败模式包括识别“空抓”empty-grasp操作及误判成功的情况。这种汇总机制确保规划器在处理不同任务时能够避免重蹈覆辙。部署评估阶段。在针对未见过的环境变体包括位置互换、指令重定向以及基于多个初始状态种子的测试进行正式评估时该驾驭harness实施严格的执行规范完全禁用 RESET 原语并大幅缩减操作步骤的限额。为了解决这些经扰动的任务规划器 Π 从“特定任务记忆”Task Specific Memory中检索预计算的 JSONL 轨迹数据并结合实时的 RGB-D 观测信息进行动态落地执行。智体依据全局记忆中积累的成功规则与失败模式以确定性的方式执行该轨迹。在此严格阶段取得的性能表现直接构成本文报告的基准测试结果从而验证 Harness VLA 框架的整体有效性。3 统一原语接口原语库 P 是暴露给规划器的唯一动作接口。每个原语通过单个 JSON 对象进行调用在环境中执行直至满足内部后置条件随后交还控制权并返回更新后的观测数据。规划器从不直接输出低级力矩、关节目标值或动作片段它负责选择原语并根据语言指令、RGB-D 观测、本体感知及记忆信息来绑定原语参数。将 P 划分为两大操作原语族。解析式原语Analytic primitives是基于模型的确定性控制器由机器人运动学定义无需训练数据。它们又细分为复合原语composite primitives接收世界坐标系下的空间目标并运行内置求解器以协调多个自由度以及原子原语atomic primitives驱动单个固有通道如手腕朝向、夹爪状态或底盘速度达到参数化设定点。VLA 原语VLA ACT是一种基于学习的策略调用将提示信息prompt和实时相机画面映射为动作片段以实现局部的、富含接触交互的行为。用于探索的RESET工具仅在引导阶段bootstrapping使用不计入操作原语范畴。表 1 列出贯穿本文使用的原语词汇表。该共享操作接口包含六个解析式原语和一个 VLA 原语RoboCasa365 额外使用两个移动底盘原语——NAVIGATE TO导航至和MOVE BASE移动底盘——用于厨房场景下的任务预置与布局调整。关键在于原语词汇表在评估前即已固定规划器无法在部署阶段自行创建新原语。下方的简洁 JSON 契约展示该共享接口基于 VLA 的接触原语。VLA ACT是用于富含接触交互场景的学习型原语。在各项基准测试中VLA ACT涵盖了抓取、受限放置、夹具操作、按键、抽屉或门体操作、插入动作以及特定具身形态下的接触行为。规划器提供一个任务相关的提示信息prompt和一个提前终止谓词 tau。随后冻结参数的 VLA 模型 f_theta 输出动作片段直至满足 tau 条件或耗尽动作片段配额。这种设计使 VLA 保持作为“局部接触专家”的角色而语义接地semantic grounding、空间重绑定spatial re-binding、导航、重置re-staging以及长程任务组合long-horizon composition则由规划器planner控制。驾驭将执行循环实现为一种基于文件的同步式“读取-求值-打印循环”REPL。一个长期运行的环境工作进程worker维护着实时的仿真器状态而规划器 Π 仅通过序列化的原语调用及持久化的观测数据与该状态进行交互规划器无法访问仿真器的特权状态、物体位姿或控制器的内部机制。任务特定记忆Task Specific Memory。任务特定记忆存储已解决任务实例的可复用结构。它包含程序性 JSONL 轨迹和语义性 JSON 摘要。轨迹记录执行了哪些原语调用摘要则记录了该策略为何有效以及应避免哪些做法。成对的过程轨迹trace存储了基元primitive的执行顺序。该“轨迹”是一个任务级的解决方案框架而非开环轨迹。它记录分析型原语与基于 VLA原语的执行顺序、VLA 调用的位置以及涉及接触的执行、搬运、释放和验证各阶段之间的转换点。存储轨迹中的空间参数被视为“参考场景绑定”reference-scene bindings。在部署阶段规划器会复用该内存结构但会根据当前观测结果重新将物体、固定装置、支撑表面及目标位姿进行“重新接地”re-grounding即重新建立与当前环境的关联。全局记忆。全局记忆存储了供原语库使用的、与具体任务无关的操作知识以便在重试前进行诊断。迭代式记忆构建。记忆是在交互过程中构建的而非仅在完整执行rollout结束后才写入。在执行每个原语primitive动作后规划器会读取新的观测数据和诊断记录并将结果分类为进展、可恢复的失败或不可恢复的失败。成功的执行过程会被存储为“特定任务记忆”Task Specific Memory。可恢复的失败记录会保留在轨迹中并在语义摘要中加以说明以便后续步骤记录纠正措施。失败的尝试也会作为负面证据保留并可能为“全局记忆”Global Memory贡献失败模型。在多次尝试的过程中记忆是经过提炼优化的而不仅仅是简单的累积。如果后续尝试能产生更短或更可靠的解决方案便可替换原有的程序化轨迹同时早期的失败观测数据依然具有价值可作为未来规划的约束条件。这种分离机制使得 Harness VLA 能够迁移任务的求解方法而无需机械地重现参考场景中物体的具体位置。通用解析式原语。MOVE TO是共享的末端执行器移动原语它接收一个基于世界坐标系的笛卡尔目标并将其委托给当前环境中可用的求解器。其内部后端可以是操作空间伺服控制器、基于雅可比矩阵的控制器或逆运动学IK规划器但对外暴露的原语语义是相同的。MOVE POSE在MOVE TO的基础上进行了扩展使位置与姿态分量如俯仰角pitch同步变化当环境不直接支持此功能时可通过组合ROTATE PITCH和MOVE TO来实现相同的行为。ROTATE WRIST和ROTATE PITCH分别应用偏航角yaw和俯仰角pitch设定值同时保持当前的空间位置不变。SET GRIPPER将夹爪驱动至打开或关闭状态而RELEASE是相应的夹爪打开原语并包含“释放”这一后置条件。特定于环境的夹爪操作惯例被封装在原语接口之下。移动底座与双臂操作细节。RoboCasa365 增加两个移动底座原语因为厨房尺度的任务需要在固定机械臂的工作空间之外进行预备操作。NAVIGATE TO是一个复合原语驱动底座向世界坐标系下的平面目标点移动而MOVE BASE是一个原子原语通过应用局部底座速度设定值来实现精细的位置调整。RoboTwin C2R 未引入新的操作原语名称相反每个原语都可以通过机械臂参数绑定到左臂、右臂或双臂任务模式。因此交接类任务被表示为双臂绑定模式下VLA ACT、解析式移动原语和RELEASE原语的组合而非单独的原语。VLA ACT。VLA ACT是该原语集合中唯一一个基于学习的原语。它绑定到当前基准测试所使用的冻结 VLA并根据提示prompt和实时观测数据执行动作片段action chunks。规划器配置一个停止谓词 τ该谓词可对应于“提起并抓取”条件、接触状态条件、基准测试谓词或动作片段数量限制。因此该原语涵盖抓取、放置、夹具操作、插入和双臂接触等动作同时保留规划器在语义接地semantic grounding、空间重绑定、导航和重定位re-staging方面的职责。实验设置在四个基准测试系列上评估 Harness VLA。桌面操作tabletop系列包括 LIBERO [19] 和 LIBERO-Pro [20]家庭场景和双臂操作系列则分别为 RoboCasa365 [21] 和 RoboTwin C2R [22]。在所有评估中规划器均基于同一套固定的基元词汇表 P 运行且不允许在部署阶段引入新的基元。VLA 基元通过针对特定基准测试的固定策略frozen policies进行实例化同时保持统一的 VLA ACT 接口针对 LIBERO 和 LIBERO-Pro 使用 RLinf 发布的 π0.5-SFT 检查点记为 π_RLinf [23]针对 RoboCasa365 使用固定的 RLDX-1 RoboCasa 检查点 [24]针对 RoboTwin C2R 使用训练后的 LingBot-VLA 检查点 [25]。Harness VLA (Codex) 和 Harness VLA (CC) 分别表示使用 Codex 和 Claude Code 规划器实例化的同一 Harness 系统CC 即 Claude Code 的缩写。π_RLinf、RLDX-1 和 LingBot-VLA 对应的行作为各自基准测试的直接固定 VLA 基线baseline。LingBot-VLALingBot-VLA [25] 是 RoboTwin 后端用于双手动操作的视觉-语言-动作VLA模型。它是一个大规模的 VLA 基础模型旨在实现跨各种真实世界实例的连续机器人控制。本工作用 RoboTwin 后训练的 LingBot-VLA 检查点作为 Harness VLA 框架内的冻结底层执行模块。架构。该模型基于预训练的 Qwen2.5-VL 视觉语言骨干网络构建并扩展混合 Transformer (MoT) 架构将视觉语言推理和动作生成分离到专用的 Transformer 路径中。这些路径通过共享的自注意机制耦合从而实现统一的多模态序列建模同时减轻跨模态干扰。引入一个动作专家模块用于预测基于多模态嵌入的连续控制信号。动作建模。 LingBot-VLA 采用流匹配公式进行连续动作预测。为了提高长时域操作的时间一致性它采用分块动作解码即在单次前向传播中自回归预测固定长度的动作序列。分块大小设置为 T 50从而实现稳定且时间一致的控制。训练。首先该模型在 9 种机器人实例上收集的大规模真实世界双臂远程操作数据上进行预训练从而提供广泛的跨实例泛化能力。然后通过在 RoboTwin 操作轨迹上进行监督微调 (SFT) 来进一步调整模型使其专门用于双臂操作任务。在后训练阶段之后所有直接 VLA 和 Harness VLA 评估中的检查点均保持冻结状态。训练配置。在表 14 中总结控制后训练的关键超参数。这些参数对应于本文报告的所有 LingBot-VLA 后训练实验所使用的配置。性能。在 RoboTwin 随机评估设置下LingBot-VLA 在直接冻结智体配置即作为独立策略不进行智体级分解或外部规划下取得了 50.4% 的成功率。该直接基线与主表中的外部 π0.5 对比有所不同LingBot-VLA 是 Harness VLA 使用的 RoboTwin 专用冻结 VLA 后端而 π0.5 是一个具有代表性的外部 VLA 基线。结果表明LingBot-VLA 在进行智体级分解之前就已经具备强大而稳定的接触丰富操作能力。在本文中LingBot-VLA 被用作 Harness VLA 中的冻结执行模块作为 RoboTwin 双手动控制的底层接触丰富操作原语。
郑州网站建设
网页设计
企业官网