
1. 项目概述当智能体学会“看路况”与“算时间”最近在AI圈里尤其是做具身智能和机器人规划的同行们讨论热度最高的一个词可能就是“Agentic”了。它不再是那个简单的“代理”而是指一种具备高度自主性、能主动感知、决策并执行复杂任务的智能体。我们团队最近在啃的一个硬骨头就是如何让这样的智能体在面对一个动态变化的真实物理场景时不仅能理解“现在”是什么样更能推演“未来”会怎样并据此生成一个靠谱的、能落地的行动计划。这听起来有点像让一个自动驾驶系统不仅要识别出眼前的红绿灯和行人还要预判三秒后那个行人会不会闯红灯旁边的车会不会突然变道然后提前规划出一条最安全、最流畅的路线。我们把这个核心挑战提炼为“Temporal Grounding in Agentic Scene-to-Plan Reasoning”翻译过来就是“智能体从场景到计划推理中的时序接地”。拆开看“Scene-to-Plan”是目标从对环境的感知Scene直接推导出可执行的行动序列Plan。“Agentic”是主体属性强调智能体的主动性和目标导向性。而“Temporal Grounding”时序接地则是我们解决这个问题的关键钥匙也是最难的部分。什么叫“时序接地”你可以把它理解为智能体对时间维度的“常识理解”和“物理直觉”。它不仅仅是给每个物体贴上一个时间戳而是要求智能体能够推断动态从静态的、瞬间的场景观测中推理出物体和事件是如何随时间演变的。比如看到一个球被抛向空中要能推断出它接下来的抛物线轨迹。预测交互预判多个动态实体之间未来可能发生的交互和因果关系。例如预判一个奔跑的小孩可能会撞到另一个正在滑滑板的人。锚定时机将抽象的行动步骤如“绕过障碍物”精准地锚定到具体的时间窗口和场景状态上。知道“在行人走到路中间之前”完成变道而不是一个模糊的“稍后变道”。没有时序接地的智能体其计划往往是“刻舟求剑”式的。它基于一个静止的快照做决策一旦环境变化计划立刻失效。而具备了强大时序接地能力的智能体其计划则是“动态适应”的像老司机一样心中有一条随时间流动的“路况流”能随时微调方向盘。这个项目就是探索如何将这种时序接地的能力深度融入到智能体从感知到规划的完整推理链条中。我们不再满足于让大语言模型LLM或视觉语言模型VLM生成一个静态的任务列表而是要让它们输出一个带有时序约束和条件分支的行动蓝图。这对于自动驾驶、家庭服务机器人、工业流程自动化等需要在高动态环境中可靠运行的领域具有根本性的意义。2. 核心思路构建“场景-时序-计划”的三层推理框架要实现从提示词Prompts到实际执行Pavement的跨越关键在于设计一个能显式建模和处理时间信息的推理架构。我们摒弃了那种将感知、预测、规划模块简单串联的流水线思路而是尝试构建一个以“时序”为贯穿主线的三层协同推理框架。2.1 第一层基于多模态大模型的场景时空解构一切的起点是智能体通过传感器摄像头、激光雷达等获取的原始观测数据。传统方法可能直接用一个目标检测模型框出物体了事。但在我们的框架里第一步是使用一个强大的多模态大模型如GPT-4V、Gemini等对场景进行深度的“时空解构”。这个解构过程远不止于识别物体。它需要模型输出一个结构化的场景表示至少包含以下维度实体及其属性不仅仅是“一个人”、“一辆车”还要包括其速度静止、慢走、奔跑、方向、姿态站立、弯腰、以及可能的内在状态如提着购物袋的人可能走向停车场。实体间的空间关系不仅是“A在B左边”而是“A正在接近B”、“B位于A的预期路径上”。事件的初步推断基于当前姿态和物理常识推断可能正在发生或即将发生的瞬时事件。例如“行人正在抬头看交通灯可能准备过马路”、“球正在地面上滚动速度在衰减”。实操心得直接让VLM输出JSON格式的结构化信息往往不稳定。我们的做法是设计一套非常精细的提示词Prompts将任务分解。例如先让模型用自然语言描述场景的动态要素再通过一个后续的小型解析模型或规则引擎将描述转换为结构化的时空图。这比一步到位的效果更可控。这个阶段的输出是一个带有初步时序语义的“富场景图”。图中的节点是实体边不仅代表空间关系还标注了动态交互的潜力如“可能碰撞”、“正在追随”。2.2 第二层时序动力学模型与概率预测拿到富场景图后就进入了核心的“时序接地”层。这一层的目标是回答“接下来几秒或几分钟这个场景最可能如何演变”我们探索了两种主要技术路径的融合基于物理规则的推理对于运动规律明确的物体如抛射体、车辆直接嵌入牛顿运动学方程进行确定性预测。这部分可靠但覆盖范围有限。基于学习模型的概率预测对于智能体人、动物等行为不确定性高的实体我们引入或微调轨迹预测模型。但不同于自动驾驶中只预测轨迹点我们要求模型同时预测“行为意图”和“潜在交互”。例如预测行人“有80%概率在绿灯亮起时过马路20%概率继续等待”。这里的关键创新点在于“交互感知的联合预测”。不是独立预测每个实体的未来状态而是建立一个轻量级的交互模型考虑实体间的相互影响。比如预测行人的路径时会考虑前方车辆是否可能右转挡住人行道。这一层的输出是一个多分支、带概率的时序场景演变树。每一个分支代表一种可能的未来场景序列并附上了发生的概率。这为后续的规划提供了应对不确定性的基础。2.3 第三层条件时序规划与计划生成最后一层是规划层它接收“当前富场景图”和“未来可能演变树”作为输入生成具体的行动计划。这个计划必须满足两个核心要求目标可达性和时序可行性。我们采用了一种条件时序规划Conditional Temporal Planning的方法。规划器可以是一个经过提示工程的大语言模型也可以是一个专门的符号规划器的任务是识别关键时序约束从预测中提取硬性时间窗口。例如“必须在未来1.2秒内完成刹车以避免与突然出现的自行车相撞”。生成带条件分支的行动序列计划不是线性的而是树状的。例如步骤1沿当前车道行驶持续监测行人A。步骤2如果行人A在t2秒时踏上斑马线则执行“减速礼让”子程序。步骤3否则如果行人A保持静止则在t2.5秒时开始加速通过。步骤4同时监测右侧车辆B的转向灯。如果灯亮则预留更宽安全距离。评估计划的风险与稳健性利用第二层生成的概率计算每个计划分支的总体成功概率和预期风险如最小碰撞时间。选择在大多数可能未来下都表现稳健的计划。最终生成的计划是一个机器可解析的、包含动作原语、触发条件、时序等待和循环结构的脚本。它直接对接底层的控制系统如机器人的运动控制器、自动驾驶的决策模块实现从认知到行动的闭环。3. 关键技术实现与模型选型将上述三层框架落地涉及到一系列具体的技术选型和实现细节。这里分享我们踩过坑后的一些选择。3.1 多模态理解与场景图构建我们测试了多个开源和商用的VLM。最终出于对动态属性描述能力和成本的综合考虑我们选择了“小模型协同”的策略。主力模型使用InternVL或Qwen-VL这类效果接近第一梯队但API成本更可控的模型负责生成初步的、丰富的场景自然语言描述。属性细化模型针对描述中的关键动态实体如移动的车辆、行人再用一个轻量化的、专门训练过的模型如基于YOLO光流估计的小网络来精确量化其速度、方向。关系与事件解析我们将场景描述文本通过一个我们微调过的小型文本解析模型如基于BERT架构 按照预定义的Schema抽取出结构化的实体、属性和关系自动构建成场景图。这个解析模型的训练数据是我们用GPT-4合成的大量“场景描述-场景图”配对数据。避坑指南完全依赖一个大而全的VLM输出结构化数据在复杂动态场景下格式错误率很高且API调用延迟和成本是持续运行的瓶颈。将任务拆解让专业的小模型处理专业的子任务整体Pipeline的稳定性和效率更高。3.2 时序预测模块的设计这是整个系统的计算核心之一。我们放弃了训练一个端到端的、输入当前帧输出未来序列的“黑箱”模型因为它的可解释性差且难以融入物理规则。我们的预测模块是一个“混合专家系统”刚体运动专家对于符合刚体运动假设的物体车辆、滚动的球直接使用卡尔曼滤波或更简单的匀速/匀加速模型进行预测。计算快结果可靠。行人行为专家采用基于社会力模型Social Force Model或图神经网络如Social-GAN, Trajectron的预测模型。但关键是我们对其进行了改进输入不仅包括历史轨迹还包括从第一层场景图中提取的语义目标点如交通灯、商店门口、停车位。这使预测从单纯的轨迹外推变成了带意图的路径预测。交互推理器一个轻量的逻辑推理模块基于常识规则处理特定交互。例如“如果预测行人路径与车辆路径相交且时间接近则标记为‘潜在冲突’并调整双方预测轨迹的概率权重。”这个混合系统以场景图中的实体为处理单位为每个实体分配合适的“专家”进行预测再通过交互推理器进行协调最终生成带概率的联合未来序列。3.3 条件时序规划器的实现规划器需要处理符号信息场景图、数值信息预测轨迹、概率信息分支概率和时间约束。我们评估了纯符号规划器如PDDL和纯神经规划器用LLM发现各有优劣。我们最终的方案是一个“神经-符号”混合规划器LLM作为策略提议器我们使用DeepSeek-Coder或Code Llama这类具有较强代码和逻辑推理能力的模型。提示词中我们将当前场景图、预测的主要分支以结构化的文本形式输入要求LLM以“if-then-else”和“while-wait”的伪代码风格输出一个初步的条件行动计划草案。LLM的优势在于能理解复杂的语义约束如“礼貌地让行”。符号规划器作为验证与细化器将LLM生成的草案转换成一个形式化的时序规划问题输入到像Temporal Fast Downward (TFD)这样的时序规划器中。符号规划器的任务是严格检查计划的时间约束是否可满足例如两个动作所需的时间是否冲突并将LLM草案中模糊的时间描述如“稍等片刻”转化为精确的时间区间或持续时间。成本函数与优化我们为规划器定义了一个成本函数综合考量任务完成时间、动作能耗、预测风险概率等。规划器会在LLM提供的多个草案基础上进行微调优化找到成本最低且时间可行的最终计划。这种结合既利用了LLM的语义理解和创造性又借助了符号方法在逻辑严谨性和时间计算上的精确性。4. 系统集成与仿真测试理论框架和模块设计完成后我们需要一个高保真的环境来集成测试整个系统。我们选择了NVIDIA Isaac Sim作为我们的主要仿真平台。4.1 仿真环境搭建与场景设计Isaac Sim基于USDUniversal Scene Description格式非常适合构建复杂的、动态的测试场景。我们创建了一系列具有挑战性的测试用例城市街道交叉口包含交通灯、多个方向的车流、横穿马路的行人、突然窜出的宠物。室内服务场景一个机器人需要在有人走动的办公室中导航到某个房间取物并返回期间可能需要避让、等待或请求让路。协作装配场景多个机械臂和人类协同工作机器人需要预测工人的动作节奏插入自己的操作而不造成干扰或危险。每个场景都精心设计了触发关键时序推理能力的“陷阱”。例如一个行人先在路边看手机然后突然起步一辆车打着转向灯却迟迟不转弯等。4.2 端到端Pipeline集成我们将三个核心层模块集成为一个ROS 2节点图感知节点订阅仿真器的相机和激光雷达话题调用我们的多模态场景解构服务发布“富场景图”话题。预测节点订阅场景图运行混合预测系统发布“未来场景演变树”话题。规划节点订阅场景图和演变树运行神经-符号混合规划器生成最终的可执行计划发布为“行动序列”话题。控制节点接收行动序列将其解析为底层的速度、位置指令发送给仿真器中的机器人模型。整个数据流是异步的但规划节点会以固定的频率如10Hz被触发确保能对环境变化做出及时反应。4.3 评估指标与测试结果我们如何判断系统成功了不仅仅是“任务是否完成”更要看其“智能”程度。我们定义了多维度评估指标任务成功率在N次随机化测试中成功完成指定目标的比例。时序约束违反率计划中要求“在事件A之前完成动作B”实际执行时是否违反。平均干预次数在仿真中需要人类监管员手动接管以避免事故的次数次数越少说明自主性越高。计划稳健性评分通过蒙特卡洛方法在预测的概率分支上多次rollout执行当前计划计算平均成功概率。计算效率从感知输入到生成计划的总延迟需满足实时性要求如200ms。初步测试结果显示相比仅基于当前帧感知做规划的基线系统我们引入时序接地的系统在交叉口导航场景中的任务成功率提升了约35%干预次数减少了60%。尤其是在处理“模糊意图”行人在路边徘徊时我们的系统能生成包含“谨慎接近并准备停车”和“加速安全通过”两个条件分支的计划显著优于基线系统要么激进要么过度保守的单一策略。5. 挑战、局限与未来方向尽管取得了不错的进展但这个方向依然充满挑战我们也清晰地认识到当前系统的局限。5.1 面临的主要挑战预测的不确定性本质对人类行为的预测永远存在“未知的未知”。我们的概率预测模型只能覆盖训练数据中见过的模式对于极端异常行为如突然摔倒、跳舞无能为力。系统需要具备在极低概率事件发生时的“紧急熔断”机制。计算复杂度与实时性的平衡生成带概率的多分支未来树和进行条件时序规划计算开销巨大。在资源受限的嵌入式设备如车载电脑、机器人本体上部署是巨大挑战。我们正在研究如何对预测树进行剪枝以及开发更轻量级的规划算法。仿真到现实的差距Sim2Real仿真中训练的预测模型其物理引擎和人物行为模型与真实世界存在差异。如何让系统在仿真中学到的“时序常识”能够迁移到现实是工程落地的最后一道难关。我们正在尝试使用真实世界轨迹数据进行预测模型的微调并在仿真中增加更多的随机扰动和域随机化。长时程规划的模糊性对于需要规划未来数分钟甚至更长时间的任务如城市级导航预测的准确性会急剧下降。此时系统可能需要更高层级的、更抽象的策略如“选择拥堵更少的路线”而非精细的时序动作规划。这引出了分层规划的需求。5.2 与Agentic RAG等前沿方向的结合“Agentic RAG”智能体检索增强生成是当前另一个火热的方向。我们认为它与我们的“时序接地”研究有天然的互补性。RAG作为世界知识库我们的预测模型和规划器其知识本质上是内化的、参数化的。对于罕见但已知的时序模式如某种特殊的交通手势、某个地区的行人习惯可以通过RAG系统从外部知识库如交通法规文档、地区行为研究报告中实时检索相关信息作为提示词输入给LLM规划器从而增强系统对长尾场景的处理能力。时序接地为RAG提供上下文当智能体进行决策时RAG检索什么信息我们的时序场景演变树提供了极其宝贵的上下文。例如当系统预测到前方有学校区域时可以主动触发RAG检索“学校附近限速规定”和“儿童行为特点”等知识从而生成更谨慎的驾驶计划。未来一个强大的自主智能体很可能是一个融合了深度时序接地能力、外部知识检索能力Agentic RAG以及复杂技能调度能力的混合系统。5.3 对工业界应用的初步思考这项技术要走出实验室必须找到合适的应用切入点。我们认为初期可能更适合半封闭、结构化程度较高的场景例如港口、机场的AGV调度车辆路径相对固定但需要预测其他AGV和人类工人的移动实现高效、安全的协同。高端仓储物流机器人在货架间穿梭时需要预测其他机器人的行进意图避免死锁和碰撞。辅助驾驶系统中的特定功能如城区领航辅助City NOA中对“鬼探头”、行人犹豫不决等场景的精细化处理。在这些场景中环境的动态元素相对可控预测的难度稍低可以更快地验证价值并迭代技术。这个项目做到现在我最深的一点体会是让AI理解“时间”远比让它识别“物体”要困难得多。这不仅仅是技术问题更是一个如何将物理世界的常识、因果逻辑形式化的问题。我们构建的这套框架只是朝着“具身智能”迈出的一小步。真正的挑战是如何让机器像我们一样在纷繁变化的万物中看到那条贯穿过去、现在与未来的名为“因果”的细线并沿着它稳健地走向目的地。每一次测试中看到机器人因为预判了一个行人的意图而提前半秒开始平滑减速那种感觉就像教会了它一点点真正的“谨慎”和“远见”。路还很长但方向已经越来越清晰了。