ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

世界模型的定义虽然很乱,但闭环正在收拢。

世界模型的定义虽然很乱,但闭环正在收拢。 一个机器人伸手去拿桌边的杯子。半秒前它看到杯子还在桌沿。半秒后有人把杯子往里推了几厘米。如果它只是记住了上一帧画面动作会非常准确地伸向一个已经不存在的位置如果它能理解“我这一伸手之后世界会怎样变化”它才有机会停下来、重算路径甚至换一种抓取方式。对视频生成模型来说这只是画面连续性问题。对机器人来说这是一次会不会失败的行动。世界模型真正的分野就藏在这半秒里它到底是在生成一个看起来合理的世界还是在为一次动作之后的世界承担预测责任原文链接世界模型的定义虽然很乱但闭环正在收拢。01 我们听到的世界模型可能压根不是一类。今年 6 月李飞飞教授与 World Labs 团队发布《A Functional Taxonomy of World Models》试图给越来越拥挤的“世界模型”概念画一张地图。从经典的 POMDP 框架出发按系统“输出什么”把世界模型分成三类输出像素的渲染器、输出几何与物理状态的模拟器以及输出动作的规划器。两个月后来自清华大学的研究学者发布了技术报告《General World Models from First-Principles》。这篇工作不再从现有产品出发做归类而是从第一性原理追问一个世界模型要走向“通用”内部究竟需要具备哪些能力前一篇按模型的输出功能整理现状后一篇沿着理解、预测、行动与反馈推演路线。两篇工作一前一后刚好把今天世界模型的分歧展开了。这背后也暴露了一个行业越来越难回避的问题今天大家说的“世界模型”可能压根不是同一种东西。视频生成、3D、自动驾驶和机器人团队都在用世界模型。成果物可以是一段逼真的视频、一座能实时探索的数字空间、一套机器人训练环境也可以是智能体脑中用于预测与规划的内部模型。看上去都在“构建世界”但解决的问题却相差很远。视频生成模型学习的是像素随时间变化的规律。它要保持人物、场景和运动连续让一段从未发生过的视频看起来足够合理。交互式世界生成模型再往前走一步。用户可以改变视角、移动角色或持续输入指令模型据此生成后续环境。这里的关键从一次性生成变成了状态能否持续、输入能否即时改变未来。机器人领域的世界模型又是另一套要求。它不只需要预测“下一帧长什么样”还要预测夹爪向左移动两厘米、手腕旋转一个角度之后物体会不会滑落、碰撞或偏离目标。预测最终要落到动作上还要接受真实世界的检验。三者之间并非泾渭分明好的规划需要模拟行动后果好的模拟也常常需要被渲染成人类或机器可读的观测。那究竟应该怎么分类好像之前一直没有标准。02 混乱是因为行业初期还是根本没有标准说到这世界模型早就过了“因为太早所以说不清”的阶段。从自驾到大模型时代再到现在具身世界模型的声音根本就没断过。今天真正缺的是一套能够衡量视频生成、交互环境和机器人行动的共同能力坐标。只是具身让这件事变得紧迫罢了。近日生数科技在《General World Models from First-Principles》中给出 L1—L5 五级路线从生成世界、与世界交互、在世界中行动一直走向自主世界智能体和世界组织者。这套分级还不算行业标准但它提供了一把有用的尺子——每升一级模型都要把更多能力接进反馈回路。看着这个表L1 到 L3 的差别我觉得用学习骑自行车这件事儿可以讲得更明白。也对应我们常看到的几类世界模型。所谓L1就是让模型先坐在路边看理解骑车这件事应该是怎么样的如何上车、怎么样会摔倒解释的是骑车这件事通常怎样展开如果中间有人突然插入你骑行的轨迹 or 有人喊你应该换种骑法L2可以根据新输入改变后续画面。世界由此从一次性结果变成一个会回应的过程。真正的门槛出现在 L3。看过再多骑车视频也不等于掌握平衡。只有坐上车转一次车把、踩一下刹车身体与道路才会共同改写下一秒一旦失衡还要根据新的反馈把车救回来。到了这一层模型的动作进入世界世界的变化又反过来修正动作。他们的Vidu Q3就是L1级别Vidu S1 对应L2Motubrain就是WAML3level。不过即使到L3也只是让闭环有了一个可以观察的雏形却没有回答规模化问题。而WM想要在真实世界中转起来绕不开三个核心问题。1世界知识怎样继续扩大2不同模态与动作如何共享状态3机器人不能等需要实时反馈。03 世界模型的闭环必须满足三个条件。谈到闭环后面的事情就比较工程了。甚至这个工程纵深很大。会做一次动作只是起点。本体换了、任务拉长、环境持续变化单次成功很快就会失去意义。世界模型的 scaling必须同时发生在三个维度知识覆盖继续扩大视觉、语言和动作共享一个持续更新的状态推理速度还要追上物理世界。1缺了底座动作策略长不大缺了塔尖再丰富的想象也落不了地世界模型比如WAM这类结构最先遇到的是一笔很难算的数据账。互联网上有近乎无限的视频。它们能告诉模型杯子会摔、液体会洒、人通常怎样完成一项任务却很少记录“末端移动了多少、夹爪何时闭合”这些动作信息。真机轨迹正好补上这一块。每一步动作和反馈都很清楚可采集昂贵、规模有限还常常与具体本体绑定。一端有规模一端有动作。世界模型要把两者接进同一个闭环需要一条从“看懂世界”逐步走向“用身体介入世界”的数据路径。所以训练世界动作模型不能陷入“视频还是机器人数据”的二选一。这个data recipe很重要《General World Models from First-Principles》中提出的 D1—D5 数据金字塔就是对这个问题的回答。金字塔底部D1 的互联网视频和 D2 的教学视频负责打开世界的广度物体如何运动任务通常怎样展开人类又如何完成一件事。到了 D3视角从旁观者转向行动者。第一视角人类视频让模型开始从“我要怎么做”的位置观察环境。D4 再加入带动作记录的人类示范把“做了什么”与“世界发生了什么变化”连接起来。塔尖的 D5才轮到真实机器人轨迹。它负责最后一步校准这副机械臂能伸到哪里夹爪怎样发力已有的世界知识如何变成这具身体真正能执行的动作。越往上数据越少、越贵动作与反馈却越来越密。金字塔的价值就在于让不同数据各司其职。视频教会模型世界通常怎样变化真实交互教会模型这具身体能够怎样改变世界。这也意味着没有动作标注的视频依然有价值。逆动力学可以从前后状态变化中反推动作线索潜空间预测与生成式建模可以学习动态规律。有限的真机数据则负责把这些规律对齐到具体本体。我们了解到Motubrain 还使用相对末端执行器动作表征试图减少不同机械臂在关节空间上的差异。按照他们之前披露的数据模型可以利用50—100条目标机器人轨迹完成适配。2各类任务需要共享一个“不断更新的世界”有了数据下一道问题是怎么把它们接起来。谁来保证视觉、语言和动作看到的是同一个世界机器人执行长程任务最怕各个模块活在不同的“现在”里。视觉刚刚看到杯子在桌边语言模块记住的目标是“把杯子递给人”规划模块也已经生成路径。可就在机器人伸手之前杯子被人挪走了。如果动作模块仍沿用几秒前的状态它会非常准确地走向一个错误的位置。每个模块单独都对机器人合起来却做错了。模块化系统边界清晰、容易调试至今仍有很强的工程价值。问题出现在任务变长、环境持续变化之后感知、规划和控制之间传递的是一张张快照而快照随时可能过期。Mixture-of-TransformersMoT处理的正是这个问题。让不同模态保留各自适配的参数结构同时通过共享注意力交换上下文。视觉、语言和动作不再依靠层层转述而是站在同一张白板前看见同一个目标与环境变化。于是长程任务不再是一条写死的动作序列。夹取落空模型更新“物体仍在原位”花瓶被挪动目标位置随之改变。下一步动作从最新状态继续计算。所以闭环能否持续关键就在于所有模块始终活在同一个“现在”。3实时反馈和大规模算力必不可少。数据决定模型懂多少架构保证几种能力活在同一个“现在”。可到了机器人的端侧还要再加一条这个“现在”不能在推理结束前变成过去。世界模型的 scaling 有一组天然矛盾。训练端希望模型更大、数据更多、理解更完整机器人端却要求它在更短时间内完成观测、预测和动作更新。离线生成一段视频多等几秒通常没有影响。但在物理世界里杯子可能正在滑动目标也可能突然被人挪走。半秒前完全正确的判断到了下一秒就可能变成错误动作。因此算力决定的不只是模型能学到多少也决定闭环能不能及时转起来。速度之外动作还要保持连续。动作模型通常一次生成一段动作等旧动作全部执行完再计算机器人会停顿中途直接切换新旧动作又容易发生跳变。之前我们分享过的生数那篇paper《World Action Models in Real Time: An Empirical Study of Smooth Execution via Asynchronous Deployment》其中讲到的Real-Time ChunkingRTC正是在处理这段交接过程。它让系统在机器人执行动作时根据新观测滚动更新尚未完成的部分同时处理新旧动作块的衔接。机器人因此可以边行动、边观察、边调整。数据扩大模型见过的世界架构维持一个持续更新的世界算力则让模型始终跟得上这个世界。4Motus2则是整个闭环跑起来的 case生数最新的 Motus2则提供了一个很值得观察的样本朱军老师之前也分享过可以理解为L3级别的进一步验证。他们把这个工作定义为用于灵巧操作的自演化通用世界模型通过模型扩展和数据扩展不断改进。而且是首次实现闭环自进化迭代这一点就很接近L4。同一模型既是策略(WAM)又是模拟器(AC-WM)还是评估器。前面的条件到了 Motus2 这里被落实了。Motus2结构一览模型上用一套共享参数统一策略、模拟与评估形成从动作提议、后果预测、结果判断到策略更新的闭环。训练上使用了约 13万小时第一人称人类数据, 涵盖单目、双目等多层次Ego数据。还有一个需要注意的是motus2对外表述的是常规数据用于训练WAM次优和失败数据用于扩展。闭环的价值这里就彰显了我们不止一次说过失败数据的价值可能远超我们当下的应用。此外这次还加入了灵巧手。部署了22/20高自由度触觉灵巧手(用的Sharpa、WUJI2)可实现类人的精细灵巧操作。通过机器人域的适配并利用触觉反馈修正接触过程中的动作。看了一下论文报告的两项真机任务中MBRL 与 Best-of-N Planning 将平均成功率从65%提高至75%。实验范围仍然有限但已经验证了闭环对策略改进的作用。不过口径上Motus2 可能仍处于 L3但仍然是生数这家公司往L4迈出的很重要一步。04 WM还远没成熟大一统在后面那最后世界模型最后会不会“大一统”我们的判断是应用形态会继续分化底层能力则会不断收敛。世界模型更大的未来藏在 L3 之后。今天的 L3还是需要有人告诉机器人要做什么。它可以在执行中调整动作但目标和任务边界大多已经由人提前画好。到了 L4人不会再把每一步都说明白。比如只给一句“把房间收拾好”模型要自己判断先整理哪里、抽屉打不开怎么办、哪些地方还需要探索。它开始为整个结果负责。L4 更难的一步是把反馈变成经验。执行失败后它要调整这一次下次遇到类似情况还应该少犯一次错。到了 L5主角从一台机器人变成了一支队伍。一个机器人搬运一个机器人检查数字智能体同步库存人类只在高风险环节确认。任务变化时谁接手、谁等待、资源怎么重新分配都需要围绕同一个世界状态调整。如果再续看之前骑车的那个例子会很有趣L3 是学会保持平衡L4 是自己选路并绕过障碍L5 则是带着一支骑行车队共同抵达目的地。会骑车还不够。它还得知道去哪以及怎么带着别人一起到达。
返回列表