
摘要本文解读 ACL 2026 长文《End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning》。该论文提出MHGPOMulti-Agent Heterogeneous Group Policy Optimization一个无 criticcritic-free的多智能体强化学习算法通过融合参数共享parameter sharing、反向奖励传播backward reward propagation与异构组优势估计heterogeneous-group advantage estimation让多智能体搜索系统里的每一个 LLM 智能体都朝着全局系统成功而不是各自的局部表现去优化其特别之处在于把组的定义从 GRPO 的同一 prompt 下的多条响应扩展成同一根问题下、中间决策不同的多条轨迹。实验表明在 HotpotQA 上端到端 MHGPO 把未优化三智能体系统的 F1 从21.45提升到50.862.4 倍EM 达到37.62%并在 2WikiMultihopQA 与 MuSiQue 两个域外数据集上给出最一致的增益而显存占用与单步训练时间都低于 MAPPO。视频讲解点击观看 B 站视频论文基本信息项目内容标题英文End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning标题中文异构组策略优化LLM 多智能体搜索系统的端到端强化学习作者Guanzhong Chen, Shaoxiong Yang, Chao Li, Wei Liu, Jian Luan, Zenglin Xu机构小米 MiLM Plus · 复旦大学 · 上海科学智能研究院会议ACL 2026Long Paperspp. 30319–30338arXivarXiv:2506.02718项目网站ACL Anthology 2026.acl-long.1399摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计三种 rollout 采样策略分类全景方法细节实验设计与结果消融实验定性案例结果对比总结关键发现局限性常见问题FAQMHGPO 和 GRPO 到底差在哪为什么去掉 critic 反而更稳组的规模应该取多大异构组带来的额外奖励方差是缺陷吗这套方法能直接搬到别的多智能体系统上吗训练过程中组内差异会不会消失参考链接背景与动机MHGPO 要解决的问题可以一句话概括多智能体搜索系统很有效但用强化学习训练它的代价太高——高在一个必须额外维护的 critic 上。大语言模型有两个绕不过去的短板知识有截止时间单次推理也难以产出稳定可控的结果。工业界的常见解法是把检索增强生成RAG与多智能体系统MAS结合起来——让若干个角色化的 LLM 智能体各自持有搜索工具通过结构化通信把高层目标拆成模块化的多上下文multi-context子任务既降低单个模型的负担也提升整个系统的可解释性。这条路线已经在多跳问答上反复验证过有效性。问题出在怎么让这些智能体真正学会配合。提示工程和逐智能体的监督微调SFT能缓解一部分问题但工程开销大、难以跟随需求演化因此研究重心转向端到端的强化学习RL。在 LLM 智能体构成的多智能体系统里这自然被表述成多智能体强化学习MARL可用的是 MAPPO 这一套LLM 当 actor再配一个同等规模的大 critic去估计联合动作价值。MAPPO 的代价在论文里被点得很明白。第一在多个异构智能体上近似联合动作价值本身就不稳定第二维护与更新一个完整 critic 会带来显著的显存与计算开销让规模化变得困难。另一条路线是去掉 critic 的组相对优化GOA例如 GRPO——它用同一 prompt 下多条响应之间的相对奖励来估计优势在单上下文场景里既省资源又稳定。但 GRPO 的假设很关键组内所有响应共享同一个 prompt比较发生在匹配的局部上下文里。多智能体系统打破的恰恰是这个前提——每个下游智能体的输入都由上游输出决定组内成员根本不在同一个局部上下文里。这正是 MHGPO 的切入点保留 GRPO不要 critic的好处同时重新定义组。研究主线从问题到结论Mermaid 图 1MHGPO 的研究主线——从MAPPO 必须维护大 critic这一痛点到把比较组从同一 prompt 扩到同一根问题的设计决策。基准/方法设计论文先用一个三智能体、极简但有效的多智能体搜索系统MASS作为研究对象因为这样最容易把算法本身的差异隔离出来。三个角色的分工是标准的检索问答流水线Rewriter负责根据原始问题生成面向搜索引擎的检索查询Reranker从召回的大量检索结果中筛选出真正相关的条目Answerer把原始问题和筛选后的证据整合起来给出最终答案。这条链条的关键特征是三个智能体不共享上下文——Reranker 只看到 Rewriter 输出的查询与检索结果Answerer 只看到 Reranker 筛出的文档。图 1三智能体 MASS 的示意——Rewriter 把问题拆成子查询Reranker 从检索文档中筛选相关片段Answerer 融合原始问题与筛选结果生成最终答案MHGPO 由四个部件拼成可以用一组记号把它写清楚。设系统的 $n$ 个智能体共享同一个 LLM backbone问题 $q$ 采样自数据集 $\mathcal{D}$。参数共享是第一个简化$n$ 个智能体$k\in{1,\ldots,n}$由同一个LLM backbone 实例化并联合优化于是多智能体学习被重铸为一个多任务学习问题同时省掉了 $n$ 份参数与显存。多智能体组 rollout 采样负责造出待比较的样本。对问题 $q$让 MASS 协同生成 $G$ 条最终响应 ${o_i}{i1}^{G}$从输入 $q$ 到每条最终响应的中间步骤序列构成一条轨迹trajectory。采样过程中第 $k$ 个智能体共产生 $G_k$ 个输入-输出对 $(q{k,i},o_{k,i},m_{k,i})$其中 $m_{k,i}$ 是组标识group identifier由具体的采样策略决定后续用来决定这条 rollout 在哪个组里被归一化。反向奖励传播负责把全局信号分给上游。MASS 生成最终响应后奖励模型或预设规则给出共享奖励集合 ${R^{\text{shared}}i}{i1}^{G}$这些奖励从轨迹末端反向传播回上游智能体并按直接后继聚合$$R^{\text{shared}}{k,i}\mathrm{Aggr}\left({R{j,r}}_{jk}\right)$$其中 $(k,j)$ 称为间接依赖对$j$ 是 $k$ 的下游消费者$o_{j,r}$ 是 $j$ 在输入中包含 $o_{k,i}$ 的前提下生成的响应。默认的聚合算符 $\mathrm{Aggr}(\cdot)$ 是简单平均。三条智能体的链里Answerer 相对金答案的 F1 就是终端共享奖励它回传平均给 Reranker再传给 Rewriter——即便智能体之间不共享上下文上下游依赖也被显式暴露出来。在传播之后每条输出的最终奖励还要叠加角色专属奖励$R^{\text{spe}}_k(\cdot)$也就是格式惩罚$$R_{k,i}R^{\text{shared}}{k,i}R^{\text{spe}}_k(q{k,i},o_{k,i})$$异构组优势估计是核心。对第 $k$ 个智能体的第 $i$ 条 rollout优势定义为在同一组标识 $m$ 内做归一化$$\hat{A}{k,i}\frac{R{k,i}-\mathrm{mean}\left({R_{l,j}\mid m_{l,j}m_{k,i}}\right)}{\mathrm{std}\left({R_{l,j}\mid m_{l,j}m_{k,i}}\right)}$$得到的标量优势会广播到该输出的全部 token即 $A^t_{k,i}A_{k,i}$。与单智能体 GRPO 的关键差异在于一个组可以包含来自不同 prompt 的 rollout这样的组被称为异构组。举个具体例子——同一个多跳问题下Rewriter 可以问出生地也可以问国籍两条不同改写路径产生的下游 rollout 会落在同一个组里被比较。这种跨轨迹归一化正是论文所说的隐式跨轨迹相关implicit cross-trajectory relations优势信号不再只是在固定上游前提下挑最好的局部动作而是携带了全局协调信息。最后是多任务聚合目标。参数共享下MAS 的 RL 目标与 GRPO 形式一致但需要把 $n$ 个智能体的损失聚合起来以支持协同优化$$\mathcal{J}{\text{MHGPO}}(\theta)\mathbb{E}\Big[\frac{1}{n}\sum{k1}^{n}\frac{1}{G_k}\sum_{i1}^{G_k}\frac{1}{|o_{k,i}|}\sum_{t1}^{|o_{k,i}|}\min\big(r^t_{k,i}\hat{A}^t_{k,i},\ \text{clip}(r^t_{k,i},1-\epsilon,1\epsilon)\hat{A}^t_{k,i}\big)-\beta D_{\mathrm{KL}}(\pi_\theta|\pi_{\text{ref}})\Big]$$其中重要性采样比为 $r^t_{k,i}\pi_\theta(o^t_{k,i}\mid q_{k,i},o^{t}{k,i})/\pi{\theta_{\text{old}}}(o^t_{k,i}\mid q_{k,i},o^{t}_{k,i})$。有了这个目标系统 rollout 阶段产生的全部内部输入-输出对都能被用来协同优化。三种 rollout 采样策略怎么造组是框架落地的关键论文给出三个策略并额外研究一个过采样变体。ISIndependent Sampling全同质是最直白的基线对每个问题依次对每个智能体采 $1$–$G$ 的 rollout 组沿用 GRPO 的相对优势形式。它只产生同质组总共 $n\times G$ 个样本组织成 $n$ 个独立的同质组。它的缺陷是效率低且目光短浅冗余 rollout 很多而且各智能体被独立优化抓不到智能体之间的交互。FoFFork-on-first入口分叉去掉冗余每个问题只在入口智能体处采 $G$ 条 rollout后续智能体一律一对一。于是入口智能体产生同质组而每个下游智能体收到 $G$ 个由上游 rollout 诱导出的不同输入天然形成异构组。整个 MASS 只需要 $nG$ 次 rollout却能得到 $G$ 个系统级奖励信号。RRRound-robin轮转分叉是两者之间的桥。FoF 总是在第一个智能体处分叉导致只有入口智能体有同质组下游智能体几乎拿不到相同输入可能拖慢收敛。RR 于是在批次层面随机选分叉点对每个样本按概率分布 ${p_i}$ 选择智能体 $i$ 作为分叉点若样本在 $i$ 处分叉则 $j\ge i$ 的智能体走 FoF 流程$ji$ 的智能体只执行一次 rollout。处理完整个批次后落在单元素组里的 rollout 会被重新打散分组再训练。论文实验里用的概率是 $(0.7,0.1,0.2)$。FoF(os)过采样则从相反方向挖掘样本利用率对每条采样轨迹让终端智能体生成 $G$ 条 rollout而不是一条从而得到更稠密的最终奖励估计再传播聚合给更早的智能体。图 3两种异构组 rollout 采样策略——FoF 只在入口智能体分叉下游全部形成异构组RR 按概率随机选择 fork 点在全局协调压力与局部学习稳定性之间取平衡三种策略的取舍可以并列看策略每样本 rollout 成本同质组异质组HotpotQA F1(%)IS$n\times G$全部无45.582FoF$nG$仅入口智能体下游全部49.429RR$nG$概率混合概率混合49.724FoF(os)$nG(G-1)$仅入口智能体下游全部50.858数据集来自多跳问答的标准配置HotpotQA 的训练集共90,447条样本训练时只把问题作为模型输入答案用于按 F1 计算奖励2WikiMultihopQA 与 MuSiQue 作为域外OOD评测。检索语料用 Wikipedia dump检索后端是 contriever——这与既有工作的设定一致便于对比。分类全景理解 MHGPO 的定位最快的方式是看它和两条既有路线的坐标系关系。Mermaid 图 2方法空间——MHGPO 落在无 critic与多智能体、多上下文的交叉位置。论文在相关工作中把已有研究归成三条线。第一条是LLM 多智能体系统AutoGen、OWL 这类框架把角色化协作推进到工程可用在检索问答里把 RAG 表述为顺序 MAS、动态路由到专家智能体、引入回溯支持可逆多跳推理等工作都报告了协作收益。第二条是面向多智能体的端到端 RL主流范式是中心化训练 去中心化执行代表是 MAPPO 与 HAPPO普遍使用参数共享来降低训练成本在 LLM 场景里已有工作把 MAPPO 用到多智能体 RAG 上或用共享 LLM backbone 做组件级优化。第三条是无 critic 的组相对策略优化GRPO、DAPO 这类方法在单上下文推理里把训练开销压得很低。MHGPO 与第三条线的关系最需要说清楚。论文用一节专门讨论这个联系在参数共享与奖励传播下MHGPO 与单上下文 GRPO 之间可以建立一条形式化桥梁——在理想化的上下文充分性context sufficiency假设 A3下MHGPO 的 token 级学习信号与在一条工具增强的单上下文转录上跑 GRPO完全对齐Proposition见下文方法细节。但在真实系统里摘要压缩、结果过滤与不对称的工具输出会让 A3 失效局部上下文被打散——MHGPO 恰恰是为这个松弛区间设计的它转而通过异构分组去利用被 A3 抹掉的跨上下文依赖。方法细节除了算法本体论文最值得单独读的是单上下文转录等价定理它解释了为什么去掉 critic 之后训练依然稳。设定是这样的固定输入问题 $q$ 与轨迹索引 $i$MASS 依次产生 $(q_{1,i},o_{1,i})\to(q_{2,i},o_{2,i})\to\cdots\to(q_{n,i},o_{n,i})$其中每个 $q_{k,i}$ 由系统模板、工具输出与上游文本拼装而成。与此对照可以构造一条单上下文转录把固定的 workflow 文本与生成的 token 交替排列$x_{k,i}$ 表示采样 $o_{k,i}$ 之前的完整前缀$\mathrm{Build}{k1}$ 确定性地追加角色模板、工具调用标记、工具输出与分隔符。构造上 $q{k,i}$ 是 $x_{k,i}$ 的一个后缀。三条假设支撑整个推导(A1) 参数共享——所有智能体共享同一自回归策略 $\pi_\theta$(A2) 确定性 prompt 构造——所有影响下游生成的工具/检索结果都被物化成 token写进 $x_{k1,i}$因此 $q_{k1,i}\Phi_k(o_{k,i})$ 是确定映射(A3) 上下文充分性智能体间 Markov 性——对每个 $k,i$构造出的 prompt 对本次生成本身是充分的$$\pi_\theta(o_{k,i}\mid x_{k,i})\pi_\theta(o_{k,i}\mid q_{k,i})$$在这三条假设下可以证明MASS 的 rollout 分布与单自回归 LLM 生成同一条转录的分布完全相同且两边都因子分解为 $\prod_{k1}^{n}\prod_{t1}^{T_{k,i}}\pi_\theta(o_{k,i,t}\mid x_{k,i},o_{k,i,t})$。进一步地奖励传播把终端奖励 $R_i$ 回传并广播到每个生成 token于是重要性采样比与优势在两个视角下逐一相等$$r^{\text{MAS}}{k,i,t}(\theta)r^{\text{tr}}{k,i,t}(\theta),\qquad A^{\text{MAS}}{k,i,t}A^{\text{tr}}{k,i,t}A_{k,i}$$因为裁剪操作只依赖 $(r,A)$ 这对量裁剪后的 GRPO 代理目标逐 token 一致。论文对这条定理的定位说得非常克制值得引用它的原话意思这主要是一条概念性桥梁而不是实现声明——MHGPO 实际做的仍然是多任务、多上下文优化并且在实践中比把单上下文 GRPO 生硬地套到长转录上收敛更快、更稳。A3 是理想化的理论锚点用于形式化理想单转录视角与实际多上下文执行之间的差距当 A3 被打破时MHGPO 靠异构分组利用隐式的智能体间相关性来实现全局协调。值得注意的是论文对随之而来的额外奖励方差的立场。下游智能体如果被一个糟糕的上游前缀拖累无论自身动作好坏都只能拿到低奖励。作者认为这不是缺陷而是优化系统级协调、而非前缀条件下的局部最优的直接结果机制上它会隐式地给协调已经失败的轨迹降权从而把学习导向全局成功的交互模式。RR 策略在这里起到桥梁作用——它随机混合异构更新与同质比较让每个智能体同时获得全局协调信号与更干净的、以输入为条件的监督。另一个补充因素是渐进同质化progressive homogenization随着共享 backbone 在训练中收敛组内多样性自然下降异构组逐渐近似同质组——这条观察在实验部分有直接的曲线证据。图 2MHGPO 框架——对每个 MASS 输入采样多智能体 rollout每条轨迹拿到终端奖励后反向传播并聚合得到逐 rollout 的奖励标签再据此用组相对目标优化共享 backbone实验设计与结果实现细节实验跑在一台配备8 张 NVIDIA H100每张 80 GB HBM3与 Intel Xeon Platinum 8468 的机器上。骨干模型统一用Llama3.1-8B-Instruct三个智能体的 prompt 在既有工作基础上做了小幅修改以简化实现。MAPPO 基线的 critic 采用与 actor完全相同的 backbone 架构以保证建模能力可比。R1-Searcher 与 Search-o1 使用官方默认实现只替换 backbone LLM 与检索引擎。训练配置只做强化学习不做任务相关的 SFT 热身训练一个 epochbatch size 为512共176步。默认组大小 $G4$RR 的分叉概率为 $(0.7,0.1,0.2)$。Actor 学习率从 ${1\text{e-}6, 5\text{e-}7}$ 中选取实测5e-7更优MAPPO 的 critic 学习率固定为 1e-6。评测指标三个答案级指标——Accuracy预测与金答案的 token 级命中率、EMExact Match要求归一化后精确匹配与 F1token 级重叠。结果取三个随机种子的平均。主结果HotpotQA 域内测试集HotpotQA域内Acc(%)EM(%)F1(%)AVG(%)Llama3.1-8B MASS未优化20.80014.00021.45218.751R1-Searcher (GRPO)36.92032.67345.39238.328MAPPO38.21734.45046.40039.689MHGPO-IS37.67733.70745.58238.989MHGPO-FoF40.45936.57049.42942.153MHGPO-RR40.86437.04349.72442.544最直接的一组对照是未优化系统与端到端训练之间的差距Llama3.1-8B backbone 下MHGPO-FoF(os) 把 HotpotQA 的 F1 从21.45 提到 50.86超过一倍。论文对这个差距的解读是单纯的提示工程抓不到智能体之间的协同适配co-adaptation也抓不到智能体对特定检索环境的适配。域外OOD结果同样被完整报告方法OOD2Wiki Acc(%)2Wiki F1(%)MuSiQue Acc(%)MuSiQue F1(%)MAPPO35.79038.72211.62619.738R1-Searcher (GRPO)35.01237.62010.23119.200MHGPO-IS34.79638.0509.88818.421MHGPO-FoF36.29939.08912.70221.633MHGPO-RR36.84039.38811.37821.144MHGPO-FoF(os)37.22240.36812.66022.677可以看到在 2WikiMultihopQA 与 MuSiQue 上所有 MARL 方法都优于未优化基线而MHGPO 家族的增益最为一致。论文也特别指出 MHGPO 没有出现 R1-Searcher 报告的那种 GRPO 不稳定现象作者的归因是每条上下文的轨迹更短、跨阶段耦合是隐式而非显式的因而基于组的收敛更快也更可靠。图 4不同 RL 算法在一个 epoch 内的训练奖励与固定 500 题 HotpotQA 子集上的验证 F1每 5 步评测一次训练动力学MAPPO 表现出更明显的抖动与更低的上限同时因为维护与更新完整 critic带来显著更高的显存与墙钟开销。IS 变体表现较差因为同质组内彼此独立的优化无法捕捉智能体间依赖限制了系统级提升。相反FoF 与 RR 通过在异构组上估计优势、并用全局奖励驱动得到更强也更稳的收敛。FoF(os) 的验证 F1 轨迹最好它在训练奖励上略低于 FoF但不增加显存的前提下训练更久泛化因此更好。逐智能体的行为变化也被跟踪下来MAPPO 的三个角色都不稳定一个合理推测是单个 critic 必须同时拟合三类不同的目标MHGPO 家族则收敛平滑——Rewriter 稳定产出两条改写查询Reranker 稳定选 2–3 篇文档最终答案变短长度降到 10 以下。效率论文单独量化了前 50 步的平均 GPU 显存占用与单步训练时间。因为去掉了 criticMHGPO 家族在这两个指标上都低于 MAPPO——去掉 critic 的收益直接兑现为显存与时间。图 5不同 MARL 算法的 GPU 显存占用%与平均训练步时秒取前 50 步均值消融实验论文的消融集中在三个问题上优化谁、怎么聚合、组多大。第一组优化哪些智能体。为了直接探测智能体间的交互论文消融了训练哪个角色。结果非常干净——只训单个角色会造成断崖式下跌冻结任意一个角色也会带来不同程度的退化HotpotQA · MHGPO-FoFAcc(%)EM(%)F1(%)AVG(%)三角色协同优化40.42136.12049.53442.025仅训 Rewriter36.79830.48146.15137.810仅训 Reranker24.24019.08230.76024.694仅训 Answerer21.18018.66729.02722.958冻结 Rewriter31.12723.98333.68929.599冻结 Reranker38.24234.18046.79239.738论文的结论是MHGPO 的增益来自在共享奖励下联合塑造三个策略而不是来自单独改进某个智能体。一个很有说服力的对照是——如果把三个智能体各自独立优化方法会精确退化成MHGPO-IS而 IS 恰好是主表里最弱的变体。第二组奖励聚合算符与奖励形式。论文先消融反向传播里的 $\mathrm{Aggr}(\cdot)$Aggr(·)RR EM(%)RR F1(%)FoF(os) EM(%)FoF(os) F1(%)AVG37.04349.72437.62350.858MAX34.12946.34336.70449.020MIN35.84047.93036.92049.842Rand35.64346.82436.60249.013平均聚合在两个分支变体上都最强MAX 与 MIN 会引入有偏信号Rand 则抬高方差因此默认取 AVG。随后论文做了压力测试剥掉全部智能体专属的格式惩罚只保留终端 F1。这个更稀疏的奖励区间伤害了所有方法但把差异放大了MHGPO-RR 仍略优于 FoF非法选择率2.8%vs3.8%F145.1%vs44.0%与它混合异构与同质比较的设计一致而MAPPO 急剧退化——F1 掉到 35.0%Rewriter 幻觉出超过 10 条子查询非法选择率 5.3%。这与critic 在稀疏、延迟奖励下信用分配困难而组相对优势估计更鲁棒的判断一致。第三组组大小。从 3 增到 4 时所有指标都有明显跃升说明更大的比较集合提供了更强的相对奖励信号随后基本饱和——4 到 6 的 F1 稳定在 49.38 到 49.53 之间跨种子方差很小。平均分最高的是组大小 6AVG 42.284F1 最高的是组大小 449.534。论文最终选$G4$作为默认值理由是它处在这个接近饱和的区间里能以更低的 rollout 成本拿到几乎相同的最终性能——这是算力与性能的折中而不是逐指标最优。FoF 组大小 $G$Acc(%)EM(%)F1(%)AVG(%)336.42134.12043.53438.025440.42136.12049.53442.025539.98936.02149.37941.796641.03036.40049.42242.284定性案例为了看清 MARL 到底给多跳问答带来了什么论文分析了一道代表性的样例对比强化学习第 5 步与第 160 步的行为。第 5 步时系统给出错误答案unknownRewriter 生成的子查询看起来合理但筛选出的片段并不包含有用信息。到第 160 步MASS 答对了——Reranker 正确锁定了两篇相关文档Scott Derrickson 与 Ed Wood 的传记条目。有意思的细节是Rewriter 此时只生成两条子查询这在人看来不如之前的改写直观但更贴合 contriever 检索器的实际行为从而检索到了目标文档。这个例子说明端到端强化学习能让 Rewriter 学会适配它所在的环境即检索引擎从而绕过性能瓶颈——而这正是手工提示工程难以覆盖的部分。图 7案例研究——同一道多跳问题在第 5 步答错 unknown与第 160 步答对的输出对比结果对比总结Mermaid 图 3性能与效率的权衡链路——从未优化系统经带 critic 的 MAPPO到无 critic 的异构组家族。关键发现端到端训练带来的增益是量级性的而不是边际的。在 Llama3.1-8B 上HotpotQA 的 F1 从21.45提升到50.86EM 从 14.00 提升到37.62——论文明确指出把 LLM 简单地包装成 MAS 而不做优化反而可能因为指令遵循失败而损害性能。去掉 critic 不是省一点而是结构性收益。MAPPO 需要维护一个与 actor 同等规模的 criticMHGPO 在前50步的平均 GPU 显存占用与单步训练时间上都更低同时四个变体的 F1 全部超过 MAPPO 的 46.40。组的定义比优势怎么算更关键。GRPO 的组要求共享同一 promptMHGPO 把组扩成同根问题、不同中间决策于是优势携带跨轨迹耦合。最弱的IS同质组45.58与最强的FoF(os)50.86之间的差距几乎全部来自组的构造方式。增益来自联合塑造三个策略。只训 Answerer 会让 F1 掉到29.03冻结 Rewriter 掉到29.60而三个智能体各自独立优化会精确退化成 IS。平均聚合是正确选择。AVG 在两个分支变体上都优于 MAX / MIN / RandRR 上 F149.72vs 46.34 / 47.93 / 46.82。组大小 4 已接近饱和。从 3 到 4 有明确跃升F1 43.53 → 49.534 到 6 基本饱和49.38–49.53因此默认 $G4$ 是算力–性能折中。异构组会自然退化为同质组。组内相似度随训练持续上升Rewriter 在第 25–30 步左右达到约0.7且与验证 F1同步上升。图 8各智能体 rollout 的组内相似度归一化到 $[0,1]$——渐进同质化假设的直接经验证据局限性论文自己列出了四条边界都非常具体任务范围仅限 QA。评测局限于多跳问答与静态迭代检索没有覆盖开放式智能体搜索、长程规划或重工具使用场景。MHGPO 在 QA 之外的通用性尤其是在动态、非平稳环境下的表现仍待探索。理论刻画不完整。论文只在理想化的上下文充分性假设下给出了与单上下文组相对优化的形式化桥梁但异构分组在局部上下文不完整时的完整方差与稳定性分析留作未来工作——这也解释了为什么作者反复强调等价定理是概念桥梁而非实现声明。模型规模上限 8B。受算力约束所有实验的 backbone 都不超过 8B 参数更大规模下的扩展行为与涌现协调效应未被测试。智能体数量固定为三。所有实验都用 Rewriter → Reranker → Answerer 这条三智能体链以对齐标准 RAG-QA 基线。MHGPO 虽然对任意 $n$ 有形式化定义但不同团队规模与非线性拓扑分支或图结构协调没有被系统评估。作者给出的未来方向是在更多样的任务与更大的智能体团队上测试可扩展性——论文认为框架本身对更广义的 MAS 是可直接扩展的。另一个值得记录的自我限定出现在渐进同质化的讨论里。作者本可以把这个现象包装成我们证明了训练收敛但他们选择了更诚实的表述当前证据本身不足以排除熵坍缩entropy collapse只能说现象与任务特定收敛一致。原因是 MAS 里的智能体是窄目标的子任务求解器而不是需要广泛探索的通用模型——通用 LLM RL 里必须保持高熵的直觉在这里并不直接适用。这个区分本身就是一个有价值的方法论提醒。常见问题FAQMHGPO 和 GRPO 到底差在哪差在组的定义。GRPO 的组由同一个 prompt 下的多条响应构成组内比较发生在匹配的局部上下文里MHGPO 的组由同一根问题、但中间决策不同的多条轨迹构成组内成员不共享局部上下文。论文进一步证明在参数共享 奖励传播 上下文充分性假设 A3 下MHGPO 的 token 级学习信号与在单上下文转录上跑 GRPO完全对齐而当 A3 被真实系统的摘要与过滤打破时异构分组才真正发挥作用。为什么去掉 critic 反而更稳两个层面。工程上去掉 critic 省掉了一整个价值网络的前向与反向显存与步时同时下降。算法上MAPPO 的单个 critic 必须同时拟合三个异构智能体的目标这是训练抖动的主要来源——论文在剥掉格式惩罚的稀疏奖励实验里给了最直接的证据MAPPO 的 F1 掉到 35.0%Rewriter 幻觉出超过 10 条子查询、非法选择率 5.3%。组的规模应该取多大从论文的数据看$G4$ 已经进入饱和区间$G3$ 时 F1 只有 43.53$G4$ 跃升到 49.53$G5$ 与 $G6$ 分别是 49.38 与 49.42——差异在噪声范围内。论文选 $G4$ 是因为它在这个近饱和区间里rollout 成本更低属于算力与性能的折中。异构组带来的额外奖励方差是缺陷吗论文把它明确表述为设计后果而非缺陷。下游智能体若被糟糕的上游前缀拖累无论自身动作好坏都只能拿到低奖励——这相当于隐式地给协调已经失败的轨迹降权把学习导向全局成功的交互模式。RR 策略则通过随机混合异构更新与同质比较进一步为每个智能体保留干净的、以输入为条件的监督。这套方法能直接搬到别的多智能体系统上吗论文的设计意图是可以。异构组的定义只依赖同根输入 组标识对任意智能体数量 $n$ 与任意拓扑都成立框架本身不绑定具体的检索流水线论文也明确说评估虽聚焦于 MASS但框架可扩展到更广的 MAS。不过论文同时承认固定为三个智能体、规模不超过 8B是当前尚未验证的两条边界。训练过程中组内差异会不会消失会而且论文有曲线证据。随着共享 backbone 收敛组内相似度持续上升Rewriter 在第 25–30 步左右达到约 0.7异构组逐渐近似同质组。关键是这条曲线与验证 F1 是同步上升的说明同质化至少没有立即伴随系统性能退化但论文坦承当前证据不足以排除熵坍缩。参考链接论文arXiv 预印本arXiv:2506.02718论文ACL 2026 正式版Long Papers, pp. 30319–30338aclanthology.org/2026.acl-long.1399PPO本文目标的裁剪形式来源Proximal Policy Optimization Algorithms, arXiv:1707.06347MAPPO本文的主要对比基线The Surprising Effectiveness of PPO in Cooperative Multi-Agent Games, NeurIPS 2022GRPO本文的优势估计形式来源DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models, arXiv:2402.03300MARFT多智能体强化微调的最新系统化工作MARFT: Multi-Agent Reinforcement Fine-Tuning, arXiv:2504.16129给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件