ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Agent 技术摘要 04 —— AI4S、VLM、VLA、VLN、WM、AI Infra

Agent 技术摘要 04 —— AI4S、VLM、VLA、VLN、WM、AI Infra 本系列为笔者在实习过程中的所见所闻记录内容为技术摘要旨在提供关于Agent领域相关技术名词的通俗和简要介绍详细内容暂不展开供同在该领域进修的童鞋们参考。01 AI4S全称是 AI for Science用 AI 去帮科学家做研究解决物理、化学、生物、气象等领域的地狱级难题。场景 A生物学痛点蛋白质是生命的基石但预测蛋白质的 3D 折叠结构极其困难传统方法测一个结构要几个月、花几百万。AI4S 奇迹DeepMind 搞出了AlphaFold直接把人类已知的 2 亿多个蛋白质结构全部预测了一遍准确率极高它的发明人直接拿了 2024 年的诺贝尔化学奖场景 B气象学痛点传统天气预报需要解极其复杂的流体力学偏微分方程超算算几个小时才能预测未来几天的天气。AI4S 奇迹华为搞了盘古气象大模型1 秒钟就能预测全球未来 7 天的天气而且预测台风路径的精度比欧洲传统的物理超算模型还准场景 C材料科学痛点找新型电池材料就像大海捞针要在实验室里一次次试错。AI4S 奇迹微软和太平洋西北国家实验室用 AI 筛选了 3200 万个候选材料只用了几个星期就发现了一种全新的固态电池材料N2116并且已经造出了原型电池如果是人类做这得干几十年02 VLMVision-Language Model视觉语言模型核心是建立视觉信息与语言之间的关联。在当前生成式多模态大模型中典型形式是pθ(y∣I,x) p_\theta(y\mid I,x)pθ​(y∣I,x)其中 I 是图像或视频x 是文本指令y 是生成的文本回答。常见架构是视觉编码器 → 跨模态连接模块 → 语言模型视觉编码器把图像转换为特征连接模块将其映射到语言模型能够处理的表示空间再由语言模型结合指令生成结果。训练通常涉及图文对齐、文本生成以及多模态指令微调。03 VLAVision-Language-Action视觉语言动作模型。VLA 把视觉和语言理解进一步连接到动作生成在机器人场景中可以把它理解为一个条件策略πθ(at∣o≤t, ℓ, st) \pi_\theta(a_t\mid o_{\leq t},\,\ell,\,s_t)πθ​(at​∣o≤t​,ℓ,st​)其中o_t当前及历史视觉观测l语言任务指令s_t机器人自身状态a_t要执行的动作这里的动作通常有明确的控制语义例如机械臂末端位移、旋转量、夹爪开合。训练常使用机器人示范数据给定观察和指令学习示范者采取的动作即行为克隆。动作既可以离散化成 token用类似语言模型的方式预测也可以通过连续动作输出模块生成。04 VLNVision-and-Language Navigation视觉语言导航。智能体根据自然语言指令和沿途视觉观测在环境中完成导航它通常可以建模为部分可观测马尔可夫决策过程POMDP即智能体每一步只能看到局部环境需要结合历史观测判断自己在哪里、指令执行到哪一步以及下一步如何移动。这里的策略同样可以写成πθ(at∣o≤t, ℓ, st) \pi_\theta(a_t\mid o_{\leq t},\,\ell,\,s_t)πθ​(at​∣o≤t​,ℓ,st​)但动作空间主要与导航有关例如前进、转向、选择下一个可达位置、停止。VLN 的难点包括语言与空间目标的对应、历史记忆、路径规划和停止时机。评价通常关注任务成功率、导航误差以及兼顾成功和路径效率的 SPL 指标。05 WMWorld Model世界模型。在具身智能和基于模型的强化学习语境里WM 的核心是学习环境如何随动作演化pθ(zt1∣zt,at) p_\theta(z_{t1}\mid z_t,a_t)pθ​(zt1​∣zt​,at​)这里 z_t 是环境状态或从观测中学习到的隐状态模型预测在当前状态执行某个动作后环境会转移到什么状态某些世界模型还会预测奖励、终止信号或未来观测。世界模型可以在内部连续推演多步形成 imagined rollout供规划算法比较不同动作序列或用于训练策略它不一定生成可观看的视频预测隐空间状态也可以实现这一目的。06 AI InfraAI Infra 是 AI Infrastructure 的缩写指“人工智能基础设施”。 这个方向主要负责让模型的训练、推理和部署跑得更快、更稳定消耗更少的计算与存储资源。方向主要解决的问题典型工作训练系统模型如何高效地在多卡、多机上训练优化并行策略、通信、显存占用和检查点恢复推理系统模型如何以较低成本响应大量请求优化请求调度、批处理、KV Cache、量化和多卡推理算子与编译器模型内部的计算如何更高效地运行用 CUDA/Triton 写 GPU kernel做算子融合和编译优化计算与集群平台GPU 资源如何分配、共享和稳定运行任务排队、资源调度、容器管理、故障处理机器学习平台如何把实验、训练和上线流程标准化构建训练流水线、模型版本管理、部署与监控这类工作的成果经常体现为训练吞吐、推理延迟、显存占用、资源利用率、稳定性和单位请求成本。如果 JD 强调 CUDA、Triton、C、体系结构通常更偏底层计算强调 PyTorch、分布式通信和并行策略更偏训练系统强调 vLLM、KV Cache、请求调度更偏推理系统强调 Kubernetes、任务调度和平台后端则更偏平台工程。
返回列表