ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

多模态技术演进:从Fusion到Reasoning Agent与World Model

多模态技术演进:从Fusion到Reasoning Agent与World Model 1. 为什么多模态研究突然变得这么“卷”如果你这两年一直在跟大模型相关的论文应该能明显感觉到一个变化2023 年之前多模态更多还是“图文对齐”“跨模态检索”这类偏感知层的任务到了 2024 年之后整个领域的重心开始往“统一建模”“推理决策”“世界模拟”这三个方向迁移。我自己的感受是单纯做 CLIP 变体或者 BLIP 改进的工作已经很难在顶会上拿到亮眼的口头报告了审稿人更关心的是你的模型能不能把图像、文本、音频、甚至结构化数据放进同一个语义空间里做联合推理能不能在复杂任务里表现出类似 Agent 的规划能力能不能对物理世界的变化做出可预测的建模。这篇梳理就是想把 2024 到 2026 这段时间里多模态领域从 Fusion 到 Reasoning Agent 再到 World Model 的演进脉络讲清楚。核心关键词包括多模态、MLLM、Reasoning Agent、World Model、Fusion。适合谁看如果你正在做多模态方向的论文复现、想找一个有潜力的选题切入或者你是工程侧需要把多模态能力落地到具体业务里那这篇内容应该能帮你省下不少翻综述的时间。我会尽量把每个阶段的代表性思路、关键技术点、以及我自己在复现过程中踩过的坑都摊开来讲不搞那种只列公式不落地的写法。先说结论性的判断2024 到 2026 这三年多模态研究的核心矛盾从“怎么把不同模态对齐”变成了“怎么让模型在统一表示的基础上做多步推理并且把推理结果反馈到对世界的建模里”。Fusion 是地基Reasoning Agent 是骨架World Model 是天花板。三者不是替代关系而是层层递进。下面我按这个逻辑展开。2. 多模态 Fusion 的演进从早期融合到统一 Token 化2.1 早期融合、晚期融合与中间融合的取舍逻辑刚入门多模态的时候很多人会纠结到底用早期融合还是晚期融合。我一开始也在这个问题上绕了很久后来发现关键不在于哪个“更好”而在于你的任务对模态间交互的粒度要求有多高。早期融合Early Fusion是在输入层就把不同模态拼在一起比如把图像 patch 和文本 token 直接 concat 成一个序列送进 Transformer。这种做法的好处是模态间交互最充分模型能看到最细粒度的跨模态关联坏处是计算量随模态数量线性增长而且不同模态的采样率、维度差异很大直接拼接容易导致训练不稳定。晚期融合Late Fusion则是各模态先独立编码最后在决策层做加权或投票。这种做法工程上最稳模态缺失时也能跑但缺点是模态间的深层交互被丢掉了模型很难学到“图像里的某个区域和文本里的某个词有强关联”这种细粒度信息。中间融合Intermediate Fusion算是折中方案在编码器的中间层做跨模态注意力比如 Flamingo 那种用 cross-attention 把视觉特征注入到语言模型里的做法。我自己的经验是如果你的任务偏感知比如分类、检索中间融合性价比最高如果偏生成比如图文对话早期融合配合统一 token 化更合适如果模态经常缺失或者异步到达晚期融合反而是最鲁棒的。2024 年之后的一个明显趋势是大家越来越倾向于把一切都 token 化然后用一个统一的 Transformer 去处理这其实就是早期融合的极端形式但通过合理的 tokenizer 设计规避了早期融合的很多问题。2.2 统一 Token 化多模态融合的“最大公约数”2024 年之后多模态统一处理成为主流思路核心做法是把图像、音频、视频都转成离散 token和文本 token 放进同一个词表里。这样做的好处是模型架构可以完全复用 LLM 的 decoder-only 结构训练目标也统一成 next-token prediction。代表性工作包括把图像用 VQ-VAE 或 ViT 加投影层转成 visual token音频用 SoundStream 之类的神经音频编解码器转成 audio token。这里有个关键细节很多人会忽略视觉 token 的粒度选择直接影响模型能力。token 太粗图像细节丢失模型做细粒度推理时会“睁眼瞎”token 太细序列长度爆炸训练成本扛不住。我复现过的一个方案是先用 ViT 把图像切成 14x14 的 patch每个 patch 过一个轻量 MLP 投影到语言模型的 embedding 空间这样一张 224x224 的图就是 256 个 token和一段中等长度的文本差不多。实测下来这个粒度在 VQA 和图像描述任务上表现比较均衡。另一个坑是模态间的 token 比例失衡。文本 token 通常几百个视觉 token 也是几百个但音频如果按帧切很容易上千。如果不做下采样或者压缩模型会明显偏向音频模态文本推理能力下降。我试过用 Q-Former 类的查询机制把视觉 token 压缩到 32 或 64 个效果在检索任务上几乎不掉但训练速度提升明显。2.3 Fusion 阶段的实操要点与常见坑在 Fusion 阶段做复现有几个地方特别容易翻车。第一是模态对齐的数据质量。很多公开数据集里图文对其实是弱对齐的图片和 caption 只有大致相关这种数据训出来的模型在细粒度任务上会很虚。我的做法是先用 CLIP score 过滤一遍把相似度低于阈值的对去掉虽然数据量少了但模型收敛后的表现反而更稳。第二是位置编码的处理。文本有位置信息图像 patch 也有空间位置如果直接把两类 token 拼在一起位置编码会混乱。常见做法是给视觉 token 单独加一套 2D 位置编码然后在跨模态注意力层里让模型自己学怎么对齐。我试过共享位置编码和独立位置编码两种方案后者在需要空间推理的任务上比如“左边那个物体是什么”明显更好。第三是训练策略。Fusion 阶段如果一上来就全参数微调很容易把预训练语言模型的能力冲掉。比较稳的做法是分阶段先冻结 LLM 只训投影层让视觉 token 先对齐到语言空间然后解冻部分 LLM 层做联合微调最后如果数据量够再全量微调。这个流程我在多个项目里验证过比一步到位全量微调收敛更稳最终指标也更高。3. Reasoning Agent多模态从“看懂”到“会想”的跨越3.1 为什么多模态需要 Agent 化Fusion 解决的是“看得见”的问题但看得见不等于会推理。举个例子给模型一张厨房照片问“按照这个布局我能不能同时煮面和炒菜”这需要模型识别灶台数量、锅具位置、甚至推断操作流程。单纯的 Fusion 模型往往只能给出“图里有灶台和锅”这种描述性回答没法做多步规划。Reasoning Agent的核心思路就是让多模态模型具备“感知-规划-行动-反思”的闭环能力。2024 年之后AI 智能体应用案例里越来越多地出现多模态 Agent 的身影。典型架构是一个 MLLM 作为大脑负责理解任务和生成计划一组工具比如目标检测器、OCR、计算器、搜索引擎作为手脚负责执行具体操作一个记忆模块负责存储中间结果和历史经验。模型在每一步根据当前观察决定调用哪个工具拿到结果后再决定下一步直到任务完成。这种架构和传统的端到端多模态模型相比优势在于可解释性和可扩展性。你可以随时往工具库里加新工具模型的能力边界就扩展了。但挑战也很明显工具调用的决策空间很大模型很容易陷入无效循环或者选错工具导致任务失败。3.2 多模态 Agent 的核心组件拆解一个能跑起来的多模态 Reasoning Agent通常包含四个核心组件。第一个是感知前端负责把原始输入图像、视频、音频转成结构化观察。这里不一定非要用端到端 MLLM有时候用专门的检测器加 OCR 反而更准。我做过一个实验在文档理解任务里先用 LayoutLM 做版面分析再把文本块和位置信息喂给 MLLM比直接把整页图丢给 MLLM 的准确率高出一大截。第二个是规划器通常由 MLLM 本身承担。规划器的 prompt 设计非常关键我试过 ReAct 风格和 Plan-and-Execute 风格两种。ReAct 是边想边做适合步骤少、反馈快的任务Plan-and-Execute 是先出完整计划再执行适合步骤多、依赖复杂的任务。实际用下来混合策略最稳先让模型出一个粗粒度计划执行过程中再根据观察动态调整。第三个是工具层。工具的描述要足够清晰包括输入输出格式、适用场景、限制条件。我踩过的一个坑是工具描述太模糊模型经常在不需要的时候调用工具或者在需要的时候不调用。后来我把每个工具的触发条件写得很具体比如“当问题涉及数值计算时调用计算器”调用准确率明显提升。第四个是记忆模块。短期记忆存当前任务的中间结果长期记忆存历史任务的经验。长期记忆可以用向量数据库实现把成功案例和失败教训都存进去下次遇到类似任务时检索出来作为 few-shot 示例。这个做法在重复性任务上效果很好模型能逐渐“学会”哪些策略有效。3.3 多模态 Agent 的训练与评测实操训练多模态 Agent 和训练普通 MLLM 差别很大。普通 MLLM 用监督微调就行Agent 需要的是轨迹数据也就是“在某个状态下采取某个动作得到某个结果”的序列。这类数据获取成本很高常见做法是用强模型比如 GPT-4V 级别的生成轨迹然后过滤掉失败轨迹用成功轨迹做监督微调。我试过用这种方法训一个小的开源 MLLM在特定任务上能达到接近大模型的效果。评测方面多模态 Agent 不能只看最终答案对不对还要看过程是否合理。我常用的指标包括任务成功率、平均步数、工具调用准确率、无效调用率。这几个指标要一起看单看成功率容易被“瞎猫碰上死耗子”的轨迹误导。比如一个 Agent 成功率很高但平均步数是人类专家的三倍那说明它的规划效率很低实际部署时成本会很高。还有一个容易被忽略的点是错误恢复能力。Agent 在执行过程中难免会出错比如工具返回异常、观察不符合预期。好的 Agent 应该能识别错误并尝试替代方案而不是一条路走到黑。我在 prompt 里专门加了“如果连续两次得到相同错误换一种策略”的指令实测下来任务成功率提升了大概 15 个百分点。4. World Model多模态推理的终极形态4.1 World Model 到底在建模什么World Model这个词这两年热度很高但很多人对它的理解还停留在“预测下一帧”的层面。实际上多模态 World Model 要建模的是“世界状态”以及“状态之间的转移规律”。给定当前的多模态观察图像、文本描述、音频模型要能推断出世界的潜在状态然后预测采取某个动作后状态会怎么变最后再解码成可观察的多模态信号。这和 Reasoning Agent 的区别在于Agent 是在真实环境里试错World Model 是在模型内部“想象”各种可能的结果。有了 World ModelAgent 可以在行动之前先在“脑子”里模拟一遍选出最优策略再执行。这大大降低了试错成本也让 Agent 的行为更有前瞻性。2024 到 2026 年World Model 在多模态领域的代表性应用包括视频预测与规划、机器人操作模拟、交互式内容生成。我关注比较多的一个方向是“基于多模态观测的物理常识推理”比如给一段视频模型要预测接下来物体会怎么运动这需要模型理解重力、碰撞、摩擦这些物理规律。4.2 多模态 World Model 的架构选择目前主流的 World Model 架构有两种路线。一种是隐空间动力学模型用编码器把观察压到隐空间在隐空间里学状态转移再用解码器还原。这种做法的好处是计算效率高因为隐空间维度远低于原始观察坏处是隐空间可能丢失对预测重要的细节。另一种是直接预测模型直接在观察空间做预测比如视频扩散模型。这种做法的好处是保真度高坏处是计算成本大而且容易过拟合到训练数据里的表面模式。我自己的实践体会是做规划任务用隐空间模型更合适因为规划关心的是状态转移的抽象规律不需要像素级还原做内容生成用直接预测模型更合适因为用户对视觉质量有要求。两者也可以结合用隐空间模型做高层规划用扩散模型做低层渲染。架构上还有一个关键选择是是否显式建模动作。如果 World Model 要服务于 Agent那动作必须作为输入显式建模模型要能回答“如果我做 A 会怎样做 B 会怎样”。如果只是做无条件的未来预测那动作可以隐式地包含在历史观察里。我建议做 Agent 相关的研究一定要显式建模动作否则 World Model 和 Agent 没法闭环。4.3 World Model 的训练数据与评估难题World Model 最大的瓶颈是数据。要学准确的动力学需要大量“状态-动作-下一状态”的三元组。真实世界的数据采集成本极高所以很多工作转向仿真环境比如用物理引擎生成合成数据。但仿真到现实的迁移sim-to-real又是另一个大坑仿真里学到的规律在真实世界里经常不成立。评估 World Model 也很棘手。常用的指标包括预测误差、规划成功率、样本效率。预测误差好算但和下游任务表现的相关性不一定强。规划成功率更直接但需要把 World Model 接到一个 Agent 上跑完整任务评估成本高。样本效率衡量的是模型需要多少交互数据才能学到有效策略这个指标对实际部署很重要但很多论文不报。我踩过的一个坑是在仿真环境里 World Model 表现很好迁移到真实数据上直接崩掉。后来发现是仿真数据的分布太窄模型过拟合到了仿真器的特定渲染风格上。解决办法是在训练数据里混入真实数据做联合训练哪怕真实数据量少也能显著提升泛化性。5. 从 Fusion 到 World Model 的工程落地经验5.1 技术选型的决策树如果你现在要启动一个多模态项目怎么判断该用哪一层技术我整理了一个简单的决策逻辑。首先看任务是否需要多步推理如果只需要单步感知或生成Fusion 就够了如果需要根据中间结果动态调整策略那就需要 Agent如果需要预测未来状态或者做长程规划那就需要 World Model。其次看数据情况Fusion 需要的是模态对齐数据相对好获取Agent 需要轨迹数据获取成本中等World Model 需要状态转移数据获取成本最高。如果数据有限建议从 Fusion 做起先把表示学好再逐步往上叠。最后看算力预算Fusion 训练成本相对可控Agent 因为要跑多轮推理推理成本高World Model 训练和推理成本都高。我一般建议团队先用小规模实验验证思路确认有效后再放大。5.2 常见工程问题的排查思路多模态项目里最常见的问题之一是模态竞争也就是模型偏向某个模态忽略其他模态。排查方法是做模态消融实验分别只给文本、只给图像、给两者看性能变化。如果去掉某个模态性能几乎不掉说明模型没学到该模态的有用信息。解决办法包括调整模态 token 比例、加模态 dropout、用对比学习辅助目标。另一个常见问题是推理不一致也就是模型在不同轮次对同一问题给出不同答案。这在 Agent 场景里特别致命因为会导致行为不稳定。排查方法是固定随机种子跑多次看输出方差。如果方差大可能是采样温度太高或者模型对某些输入本身就不确定。解决办法包括降低温度、加自一致性检查、用集成方法。还有一个坑是工具调用死循环。Agent 反复调用同一个工具每次都得到类似结果但就是不结束任务。这通常是因为 prompt 里没有明确的终止条件或者模型没有学会判断“任务已完成”。我在 prompt 里加了“如果当前信息已足够回答问题直接输出最终答案”的指令并设置了最大步数限制基本能避免这个问题。5.3 复现论文时的注意事项复现多模态论文有几个通用建议。第一是先跑通再调优不要一上来就改架构。很多论文的官方代码有隐藏的配置细节比如学习率调度、数据增强策略这些在论文里不一定写全。先按官方配置跑一遍确认能复现出报告指标再动自己的改动。第二是注意数据预处理的一致性。多模态数据预处理链条很长图像 resize 方式、文本 tokenizer 版本、音频采样率任何一个环节不一致都可能导致结果对不上。我一般会把预处理后的数据存下来确保每次训练用的是同一份。第三是记录完整的实验配置。多模态实验变量多不记录的话很容易忘记哪个配置对应哪个结果。我用的是配置文件加日志的方式每次实验的模型结构、超参、数据版本、随机种子都记下来方便回溯。6. 几个值得关注的研究方向与个人判断6.1 多模态统一处理的下一步多模态统一处理目前已经能做到图像、文本、音频的统一 token 化但视频和 3D 数据的统一还有很大空间。视频的时间维度怎么 token 化3D 的空间结构怎么和 2D 表示对齐这些都是开放问题。我个人的判断是未来两年会出现更通用的时空 tokenizer把视频和 3D 也纳入统一框架。另一个趋势是模态无关的架构设计。现在的模型多少还是为每种模态设计了专门的编码器未来可能会出现真正模态无关的架构同一套参数处理所有模态模态差异完全由 tokenizer 吸收。这对模型的泛化能力是巨大提升。6.2 Reasoning Agent 的可靠性问题Agent 的可靠性是目前落地的最大障碍。模型在简单任务上表现不错但任务一复杂错误率就飙升。我认为核心问题在于错误累积每一步的小误差会在多步推理中放大。解决办法可能包括引入形式化验证、用多个 Agent 交叉检查、设计更好的反思机制。还有一个方向是Agent 的自我进化。让 Agent 从失败中学习自动调整策略。这需要长期记忆和元学习能力目前还比较初步但潜力很大。6.3 World Model 与多模态 AGI 的距离多模态 AGI是很多人的终极目标World Model 被认为是通往 AGI 的关键组件。但我个人觉得目前的 World Model 离真正的“世界理解”还有距离。现在的模型更多是在拟合数据分布而不是真正理解因果机制。要走到 AGI可能需要 World Model 具备反事实推理能力也就是能回答“如果当时不这样做会怎样”这类问题。这个方向的研究目前还很少但我觉得是未来几年的重要突破口。谁能在多模态 World Model 里把因果推理做扎实谁就可能占据下一个制高点。我在实际复现和落地这些技术的过程中最大的体会是不要盲目追新先把 Fusion 阶段的基本功打扎实。很多 Agent 和 World Model 的问题根源其实在表示学习阶段就没解决好。另外多模态项目的工程复杂度远高于纯文本项目数据管道、训练稳定性、推理效率每个环节都有坑。建议刚开始做的时候从小规模、单任务入手跑通了再扩展比一上来就搞大而全的框架要靠谱得多。
返回列表