ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

字节:解决多教师蒸馏能力失衡

字节:解决多教师蒸馏能力失衡 标题Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation来源arXiv, 2608.19098v1️文章简介研究问题在多教师在线策略蒸馏中为何即使路由完美学生模型仍无法均衡整合各领域专家能力主要贡献论文提出Open-MOPD框架通过三种机制解决优化预算分配不均将能力恢复率从35.6%提升至83.4%。重点思路构建可控基准基于SmolLM3-3B建立包含数学、代码、指令遵循三领域的M-OPD基准使用Oracle路由排除路由错误干扰隔离能力整合动力学。诊断失衡根源发现主要瓶颈非教师间梯度冲突而是Token级优化预算的严重错配。具体表现为不同领域响应长度差异导致Token数量悬殊各领域收敛速度不同导致奖励幅度变化不一共享Rollout中多次内部更新导致学生奖励信号过时。提出Token份额平衡解耦梯度预算与序列长度通过加权使各域在损失函数中的Token贡献比例固定补偿短文本领域如指令遵循的梯度缺失。实施差距感知动态分配根据剩余师生差距动态调整各域优化预算向差距大的领域倾斜避免资源浪费在已收敛领域防止训练崩溃。引入学生奖励刷新在每次内部梯度更新前重新计算学生对数概率复用缓存的教师状态消除因策略漂移导致的奖励过时问题且无额外计算开销。分析总结 naive M-OPD仅能恢复35.6%的理论提升空间其中简短的指令遵循任务退化最严重最早停滞。 教师间的Token级分歧并非主要瓶颈高冲突Token占比极低移除或替换它们反而降低性能。 指令遵循任务虽占20.3%的提示词但因响应短仅贡献0.99%的梯度Token导致训练信号极度匮乏。 Open-MOPD的三个机制分别解决了Token数量、奖励幅度和信号时效性问题组合使用后使能力恢复率达到83.4%显著缩小了与独立专家模型的差距。 奖励刷新机制在保持吞吐量的同时提升了训练稳定性证明了处理内部更新 stale 问题的有效性。个人观点论文揭示了多任务RLHF中“看似公平”的数据采样背后隐藏的优化预算分配不公从Token粒度、动态收敛差距和时序一致性三个维度精细调控优化过程。
返回列表