英伟达与斯坦福联手打造“机器人大脑“:让机器人从经验中学习

英伟达与斯坦福联手打造“机器人大脑“:让机器人从经验中学习 这项由英伟达NVIDIA、斯坦福大学以及德克萨斯大学奥斯汀分校联合开展的研究于2026年7月以预印本形式发布论文编号为arXiv:2607.15275。有兴趣深入了解的读者可以通过该编号在arXiv平台查阅完整论文。**一切从一个问题开始机器人为什么没有记忆**假设你是一位外科医生正在做一台持续五个小时的手术。你不可能每做完一个步骤就彻底忘记之前发生的一切再从头判断该做什么。你的大脑会一直保留着这台手术从开始到现在每一刻的记忆这样你才能在第四个小时里清楚地知道第一个小时你已经处理了哪根血管、现在该进行到哪一步了。然而绝大多数现有的机器人大脑并不是这样工作的。它们就像一个严重失忆的手术助手——每次眨眼之后就只记得眼前这一秒发生了什么完全不知道过去发生了什么。在机器人领域这被称为单步或短历史视觉运动上下文——换句话说机器人的视野只局限在当下这个瞬间或者最多是几帧画面之前。这种设计在简单任务里还说得过去但一旦任务变得复杂比如要在五分钟内完成一项包含十个连续步骤的装配工作机器人就会像一个在密室里转圈的人总是忘记自己刚才走了哪条路、绕过了哪面墙。英伟达领导的这支研究团队决定从根本上改变这个局面。他们的答案就是本文要介绍的核心成果**RoboTTT**——一套让机器人策略能够记住、理解并利用超长历史经验的全新系统。---一、记忆的维度从瞬间记忆到五分钟长卷要理解RoboTTT有多不寻常先来感受一下量级差距这个概念。目前最先进的机器人基础模型其视觉运动上下文长度大约在个位数到几十个时间步的范围内。换算成时间也就是最多观察过去几秒钟的内容。RoboTTT则将这个上下文长度扩展到了**8000个时间步**——在每秒30帧的控制频率下这相当于整整超过四分钟的连续历史。这是什么概念这比现有最先进机器人策略的上下文长度足足多出了**三个数量级**也就是一千倍以上的差距。更关键的是RoboTTT做到这一切的同时**并没有让机器人的反应变慢**。传统方法中如果你想让机器人记住更长的历史就需要把所有历史信息都保存下来供随时查阅但这会让运算量随时间线性增长——机器人工作了一分钟要查阅一分钟的记录工作了五分钟就得查阅五分钟的记录越来越慢。RoboTTT用一种全新的机制彻底绕开了这个瓶颈后面会详细解释。这套系统解锁了四种在现有机器人中从未出现过、或表现极其有限的能力从人类演示视频中进行一次性模仿学习、在工作过程中持续改善自己的表现、在受到外力干扰后能自主恢复以及在跨越数十个阶段的超长任务中保持稳定的高水平表现。---二、核心机制用快速笔记代替记忆相册RoboTTT最核心的技术创新借用了一个叫做测试时训练Test-Time Training简称TTT的思想。通常来说神经网络也就是AI的大脑的学习过程分两个阶段训练阶段更新参数推理阶段即实际使用时参数冻结不动。这就像一个学生在课堂上学习然后参加考试——考试时不能再临时修改记忆只能用已有的知识回答问题。TTT打破了这个惯例。它在神经网络内部引入了一种叫做**快速权重fast weights**的特殊参数。与普通参数称为慢速权重在训练完成后就锁定不变不同快速权重在机器人实际执行任务的过程中也可以通过梯度下降AI学习的核心算法持续更新。用一个比喻来理解慢速权重就像刻在石碑上的古老知识永远不变快速权重则像你手边的一本便签本随时可以根据当前情况写下新的注记、划掉过时的内容、整理出此刻最重要的信息摘要。在RoboTTT中这本便签本是由一个小型神经网络具体来说是一个两层的MLP即多层感知机来充当的。每当机器人接收到一帧新的观察画面它就会更新这本便签本把当前状态的关键信息写进去同时自然地淡化掉不再重要的旧信息。当机器人需要决定下一步动作时它不需要翻阅过去几千帧的相册而是直接查看这本高度浓缩的便签本——因此推理速度始终恒定不随历史长度增加而变慢。从数学角度来说快速权重的更新遵循一个精确的规则在每个时间步 $t$系统将上一时刻的快速权重状态 $W_{t-1}$ 以及当前的键Key和值Value向量输入通过最小化一个均方误差损失函数来更新快速权重得到新的状态 $W_t$。然后用这个更新后的 $W_t$ 对当前的查询Query向量进行计算得到输出。整个更新然后应用的循环在训练和推理时都持续进行这就是信息被压缩进参数空间、又能随时被检索出来的关键所在。---三、架构设计在巨人肩膀上加装时间感知模块RoboTTT并不是从零开始构建的。研究团队选择了英伟达自家的**GR00T N1.7**作为基础这是一个专为人形机器人和双臂机器人设计的视觉-语言-动作VLA基础模型——可以理解为机器人界的GPT底座。在GR00T N1.7的架构中动作生成部分由一个叫做扩散变换器Diffusion TransformerDiT的模块负责它通过逐渐去噪的方式生成机器人的动作序列。RoboTTT在这个DiT的每一层共16层的注意力机制层之后都插入了一个TTT层。这个设计的精妙之处在于分工明确注意力机制层负责处理当下这一刻的所有信息——当前画面里有什么、机器人关节现在的状态、噪声化的动作序列——而TTT层则专门负责处理时间维度上的信息流动也就是把来自不同时间步的信息整合起来形成对历史的理解。除了注意力层和TTT层系统还在每个时间步的开头插入了16个寄存器令牌register tokens。这些寄存器令牌可以理解为专门的信使——它们能够在注意力层中自由地读取当前时间步的所有视觉-语言信息然后再通过TTT层把这些信息传递到时间轴上。这样的设计避免了把所有视觉-语言令牌都传过TTT层会带来巨大计算开销而是用少量的信使来高效搬运关键信息。为了防止新加入的TTT层一开始就淹没掉GR00T N1.7原有的知识研究团队还引入了一个tanh门控机制。简单来说TTT层的输出被乘以一个初始值接近于零0.001的可学习参数再加到注意力层的输出上。这意味着训练刚开始时TTT层的贡献几乎为零机器人完全依赖原有的知识随着训练深入门控参数逐渐增大TTT层的影响也越来越大整个过程平滑过渡不会产生突兀的知识冲突。---四、训练配方两个让长序列训练成为可能的秘密武器在架构之外让RoboTTT真正能够处理8000步长序列的是两项关键的训练技术。**第一项技术序列动作强制Sequence Action Forcing**RoboTTT使用流匹配flow matching来训练动作生成——这是一种与扩散模型类似的技术通过学习如何把噪声动作逐渐还原成真实动作来生成高质量的机器人行为。训练时模型需要同时处理整个时间序列上的多个动作块。一个容易犯的错误是对序列中所有时间步的动作使用同一个噪声级别要么全部处于低噪声状态任务很简单要么全部处于高噪声状态任务极难。这会让训练极不稳定——就像同时让一个学生面对一百道完全一样难度的题目要么全都太简单没有收获要么全都太难无从下手。序列动作强制的做法是**对序列中每个时间步的动作块独立采样噪声级别**。这样一来同一个训练序列中有些时间步的动作处于高噪声状态模型需要从很嘈杂的输入中重建动作有些处于低噪声状态任务相对轻松整体难度分布更加均衡训练因此稳定了许多。实验证明去掉这一设计会让模型的闭环控制性能大幅下滑机器人会产生不精准的运动无法推进任务。**第二项技术截断时间反向传播Truncated BPTT**训练神经网络时需要通过反向传播来计算梯度并更新参数。对于序列模型这意味着要沿着整个时间序列往回传播梯度同时在内存中保存每个时间步的中间计算结果。序列越长需要的内存就越多——对于8000步的序列来说这个内存消耗会直接超出GPU的承载极限。截断时间反向传播的解决方案简洁有力把长序列切分成若干个较短的段梯度只在每个段内部传播到段的边界就截断。但关键在于**快速权重本身并不截断**——它携带着压缩后的历史信息从一个段的末尾传递到下一个段的开头就像接力赛跑一样确保整个序列的上下文信息连续流动。这样GPU内存消耗由段的长度决定而不是整个序列的长度从而在固定的硬件预算下支持任意长度的训练上下文。这两项技术合在一起就构成了RoboTTT的完整训练配方让模型可以在现实可行的硬件条件下真正地从超长历史中学习。---五、从历史中学习两种全新的机器人能力拥有了长上下文处理能力之后研究团队设计了两种特殊的训练方式让机器人能够从不同类型的历史经验中学习。**能力一从人类演示视频中一次性学会新任务**机器人能不能看一段人类演示视频然后立刻模仿人类的做法这种一次性模仿学习一直是机器人领域的一个核心挑战。RoboTTT通过长上下文条件化给出了一个令人眼前一亮的解法。具体做法是在训练时把一段人类演示视频和一段机器人完成同一任务的轨迹拼接在同一个训练序列里。视频部分的数据只负责更新快速权重相当于让机器人看并理解人类在做什么而不计算动作损失机器人不会试图在这个阶段输出动作机器人轨迹部分则在更新了快速权重之后正常计算动作损失让模型学习如何在看懂了视频之后输出正确的动作。这样训练出来的模型在实际部署时就可以做到给机器人看一段人类组装某个特定配置的电路板的视频机器人就能在从未见过这个配置的情况下复现人类的组装过程。**能力二DAgger蒸馏——从失败中提炼纠错能力**DAggerDataset Aggregation是机器人学习领域的一种经典技术简单来说就是让机器人执行任务当它犯错时人类操作员介入并给出正确的纠正动作然后把这些纠正动作加入训练数据让模型从失败-纠正的对应关系中学习。标准的DAgger训练方法会把人类纠正动作作为训练目标但直接抛弃了机器人的错误动作——毕竟错误动作不应该被模仿。然而研究团队发现这些失败动作其实包含着非常重要的信息正是这些失败才让后续的纠正动作有了具体的含义。知道机器人在这一步做错了什么才能真正理解为什么纠正动作要这样做。RoboTTT的DAgger蒸馏采用了一种不对称的角色分配所有执行过的动作无论是机器人的错误动作还是人类的纠正动作都会更新快速权重但**流匹配损失只在人类纠正动作上计算**。这意味着什么快速权重见证了失败-纠正的完整过程把这种映射关系压缩进了自己的参数空间。到了实际部署时当机器人犯下类似的错误快速权重就能检索出对应的纠正模式引导机器人进行自我纠正——完全不需要人类在场干预。研究团队将这一机制类比为算法蒸馏Algorithm Distillation在机器人领域的具体落地把人类纠正的算法逻辑蒸馏进机器人的快速权重之中。---六、实验场景五分钟、十个步骤的机器人奥运会研究团队设计了三个难度递增的真实机器人实验任务全部在一个叫做YAM的双臂双手机器人平台上进行并配备了顶部、底部、左腕、右腕四个RGB摄像头。第一个任务叫Pup Go Car小狗跑车机器人需要组装一辆玩具车的车顶和第一个车轮过程包括拧螺丝、用电钻、双手协作传递工具、把车翻转过来等步骤平均完成时间约两分钟。第二个任务叫Circuit电路板机器人需要在一块电路板上安装两到三个电路元件元件的种类和安装顺序会变化共有约80种不同的配置组合训练时只见过其中20种测试时面对的是从未见过的另外60种。这个任务还可以通过一次性人类演示视频来指定目标配置平均完成时间约一分钟。第三个任务叫Gear Bot齿轮机器人这是三个任务中难度最大的。机器人需要在底盘两侧各安装一个齿轮和两个车轮需要两次翻转底盘然后安装红色的机器人头部最后拿起遥控器推动摇杆让齿轮机器人动起来——整整十个阶段平均完成时间长达五分钟。研究团队共采集了Pup Go Car任务8小时、Circuit任务6小时、Gear Bot任务5小时的真实机器人操作数据用于训练。---七、实验结果数字背后的真实含义研究团队将RoboTTT与三个基线模型进行了对比。第一个基线是原版GR00T N1.7只使用当前时刻的单帧观测第二个是GR00T N1.7 Hist.使用当前帧加上一帧历史第三个叫GDN门控DeltaNet使用与RoboTTT相同的架构框架但把TTT层换成了门控DeltaNet层——这是另一种循环记忆机制可以压缩历史信息但不依赖测试时的梯度下降来更新。评测指标分为两种一是基于详细评分表的任务完成分数0到1之间换算成百分比二是完整完成任务的试验次数。在三个任务上的平均完成分数上RoboTTT达到了79%比单步基线GR00T N1.7的42%高出了87%比表现最好的基线GDN的56%高出了41%。Gear Bot任务的结果最能说明问题在10次试验中RoboTTT有2次完整完成了所有十个阶段——而其他三个基线方法一次都没有完整完成过。换句话说面对这个持续五分钟、包含十步操作的复杂任务只有RoboTTT能够真正做到底。在Pup Go Car任务中GR00T N1.7 Hist.带一帧历史的版本的表现反而比完全没有历史的GR00T N1.7更差——39.5%对比57%。这揭示了一个容易被忽视的问题粗糙地堆砌历史帧反而会引入虚假的时间关联导致机器人在推理时出现时间错位弄不清自己现在处于什么状态。历史不是越多越好关键在于如何有效地利用历史。---八、上下文长度是一个新的缩放轴研究团队还专门研究了一个更深层的问题随着预训练时使用的上下文长度从128步增加到8000步机器人的实际表现会如何变化实验结果呈现出一条清晰的上升曲线RoboTTT的任务完成分数随预训练上下文长度的增长持续稳步攀升。从128步时接近于零的表现一路提升到8K步时的71.5%8K步版本比1K步版本高出63%比最好的短上下文基线GR00T N1.7 Hist.高出57%——而且从图像上看曲线还没有呈现出任何饱和的迹象意味着继续增加上下文长度可能还会带来进一步提升。相比之下GDN基线完全没有表现出这种随上下文长度增长而改善的趋势。研究团队认为根本原因在于两种机制的本质差异GDN的线性关联状态更新是固定形式的没有办法通过更长的训练序列来元学习自己的更新方式而RoboTTT的快速权重初始化 $W_0$ 以及更新动态都可以通过更长的训练序列中更多次的梯度更新步骤来持续优化。这是机器人领域第一次观察到预训练上下文长度作为一个独立的缩放维度带来持续的闭环性能提升类似于在大语言模型领域观察到的上下文窗口是一个重要的缩放轴这一现象。---九、一次性模仿与抗干扰长上下文的具体体现在Circuit任务中研究团队专门测试了一次性模仿学习的能力。为此他们收集了额外的人类演示视频——人类手动拼接电路板机器人在旁边静止不动四个摄像头完整记录整个演示过程。训练时对于训练集中的20种配置每种收集了5到20段不同初始布局的人类视频并将视频与机器人轨迹拼接成完整的训练序列视频部分的流匹配损失被屏蔽。测试时面对60种从未见过的电路配置机器人只能看到一段人类演示视频系统任务提示词对所有配置都一样是组装电路板不包含任何关于具体配置的信息然后独立完成组装。结果是RoboTTT在10次试验中成功完成了6次任务完成分数达到65%而GDN只有33%的任务完成分数且没有一次完整成功经常拿错元件或以错误顺序安装。这表明拥有循环记忆的GDN虽然能在某种程度上编码上下文信息但在真正需要检索和利用演示信息时它的能力明显不足而RoboTTT通过梯度下降更新的快速权重能够在需要时精准检索出演示中展示的配置信息。在抗干扰实验中研究团队在Pup Go Car任务中额外施加了人为干扰机器人安装好黄色车顶后人类把车顶取走或者机器人安装好轮胎后人类把轮胎取走。能够利用自身历史的模型应该能意识到刚刚完成的工作被打乱并返回到安装阶段重新完成。为此收集了30分钟的干扰数据并与任务数据一起训练。在车顶干扰测试的20次试验中RoboTTT成功恢复了15次GDN恢复了13次而最好的短上下文基线只恢复了10次。在轮胎干扰测试中RoboTTT和GDN都恢复了18次显著优于短上下文方法。这说明对自身历史的长上下文条件化确实能够增强机器人在任务执行过程中应对突发扰动的能力。---十、DAgger蒸馏的实际效果自我纠错能力的量化在Pup Go Car任务上研究团队系统比较了不同DAgger数据使用方式的效果。他们分别用RoboTTT和GR00T N1.7作为基础策略各收集了50条带有人类干预的DAgger轨迹共100条。标准DAgger方法只用人类纠正动作训练在四个方法上平均带来了9%的提升在两个序列模型上平均带来了13%的提升。而DAgger蒸馏快速权重接触完整交互历史但损失只在人类纠正部分计算在同样的数据上带来了平均33%的提升——RoboTTT提升36%GDN提升29%。一个对照实验证实了失败动作作为上下文的核心价值把GR00T N1.7直接在包含机器人失败动作的完整轨迹上训练也就是把错误动作也当成模仿目标其结果与只训练人类纠正动作完全相同都是57%的完成分数。换句话说对于不能利用历史上下文的模型来说失败动作的信息完全是无用的而对于RoboTTT来说这些失败动作作为快速权重更新的上下文输入极大地增强了模型的在线纠错能力。这种纠错能力的典型表现就是机器人在电钻对准螺丝时发现未能接触会自动抬起手臂重新对准再试甚至经过两次调整后才成功——这种行为完全是从DAgger蒸馏中自发涌现的无需人类在实时操作中给出任何指令。---十一、设计细节的消融实验每个零件为何不可或缺研究团队还通过消融实验逐一去掉或替换某个设计组件观察性能变化验证了各个设计选择的必要性。去掉序列动作强制之后模型的闭环控制性能大幅下滑机器人的动作变得不精准无法推进任务流程。用线性层代替MLP作为快速模型时性能比完整版本低了27%尽管仍然好于没有历史的GR00T N1.7基线——这说明快速模型的非线性表达能力对于压缩复杂的机器人历史至关重要。在渐进式构建RoboTTT的实验中从只让TTT层处理状态令牌开始加入动作令牌之后提升了23%机器人因此能感知自己的历史动作更好地理解环境动态再加入寄存器令牌之后又提升了18%。而同样数量的寄存器令牌加到GR00T N1.7上却没有任何提升说明寄存器令牌的价值来自于与TTT时间建模机制的协同配合而不是单纯的参数数量增加。---**归根结底RoboTTT意味着什么**说到底RoboTTT回答了一个既简单又深刻的问题如果给机器人一个足够大的记忆容量并且教它如何有效地利用这段记忆机器人能做到什么答案是它能像人一样跟踪自己在一项长任务里走到了哪一步能在犯错后自我调整能看懂人类的演示并复现能在遭受外力干扰后冷静恢复。这些能力听起来理所当然却是机器人领域长期以来难以跨越的鸿沟。这项研究还带来了一个对整个领域影响深远的发现预训练上下文长度就像模型参数量和训练数据量一样是机器人基础模型的一个独立的缩放维度。更长的预训练上下文持续带来更好的实际表现而且目前还没有看到天花板。这意味着未来在机器人基础模型的研究与开发中给模型更长的记忆应当和给模型更多的参数、给模型更多的数据并列成为一个核心的追求方向。当然这项研究也坦诚地承认了一些还没有解决的问题。更长的预训练上下文会显著增加训练成本研究团队在16块NVIDIA GB200 GPU上进行了30000步的预训练然后针对每个下游任务进行了20000步的微调计算资源的需求相当可观。此外虽然RoboTTT大幅提升了任务性能它仍然不能处理所有可能的失败模式——与强化学习结合直接对任务成功率进行优化是研究团队认为自然的下一步。TTT层本身的训练目标目前还是通用的均方误差是否可以设计出专门针对机器人任务特性的TTT目标也是值得探索的方向。感兴趣的读者可以通过arXiv编号2607.15275在arXiv.org上查阅完整论文或访问 research.nvidia.com/labs/gear/robottt 观看实验演示视频那里有机器人完成五分钟长任务、从人类视频学习组装、以及在受到干扰后自我恢复的完整录像。---**QA**Q1RoboTTT的快速权重和普通神经网络的参数有什么区别A普通神经网络的参数慢速权重在训练完成后就锁定不动实际使用时完全不变。快速权重则不同机器人在执行任务的整个过程中快速权重会持续通过梯度下降更新随时把当前观察到的新信息压缩进去同时淡化不再重要的旧信息。打个比方慢速权重是刻在石碑上的知识快速权重是随时可以增删的便签本。Q2RoboTTT能处理8000步上下文为什么不会变慢A传统方法要查阅历史就得把所有历史帧都保存下来历史越长查询越慢。RoboTTT不保存历史帧而是把历史信息持续压缩写入快速权重这个小型神经网络的参数中。机器人做决策时直接查阅这个已经浓缩好的参数查阅时间始终恒定不随历史长度增加而变慢。Q3DAgger蒸馏和普通DAgger训练有什么核心区别A普通DAgger训练只用人类的纠正动作作为学习目标直接丢弃机器人的失败动作。DAgger蒸馏则保留了失败动作的角色但用法不同失败动作用来更新快速权重让模型看到失败是怎么发生的而流匹配损失只在人类纠正动作上计算让模型学习纠正应该怎么做。这样失败-纠正的完整映射关系被蒸馏进快速权重机器人部署时能自主实现类似的纠错行为。