ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

[论文笔记] mixSGA HMoE BrownoutMoE

[论文笔记] mixSGA HMoE BrownoutMoE 三篇 MoE 相关论文对比梳理三篇论文分别从注意力层 KV 缓存优化、异构专家架构设计、MoE 线上推理服务部署优化三个不同维度对混合专家模型做创新下面分别解析核心思想、创新点、差异对比。1. Mixture of Weight‑shared Heterogeneous Group Attention Experts for Dynamic Token‑wise KV OptimizationEMNLP 2025mixSGA基于共享权重的异构组注意力专家混合模型用于动态逐令牌键值优化问题背景大模型推理 KV 缓存占用内存巨大GQA 等静态分组 KV 方案采用固定分组粒度无法适配不同 token 的重要程度要么丢弃低优先级 token要么统一粗粒度分组造成性能损失。核心方案 mixSGA把 MoE 思想应用到注意力模块不是 FFN 专家构建一组异构分组注意力专家各个专家拥有不同 KV 分组大小。逐 token 专家选择路由依据学习得到 token 重要性分数把不同 token 路由到不同 KV 粒度的注意力专家保留全部 token不做丢弃重要 token 分配细粒度 KV普通 token 分配粗粒度 KV。专家之间权重共享注意力投影层权重共享控制参数量开销。辅助损失函数约束路由接近 one‑hot保证训练、推理行为一致。实验效果在相同 KV 缓存预算下Llama3、OPT、Gemma2 等模型上指令微调、继续预训练任务获得更低困惑度、更高 ROUGE‑L降低 KV 内存占用优化注意力计算开销。定位注意力层架构创新解决 KV Cache 内存瓶颈。2. HMoE: Heterogeneous Mixture of Experts for Language Modeling用于语言建模的异构专家混合模型问题背景传统 MoE 全部使用同尺寸专家但输入 token 语义复杂度差异巨大简单 token 和复杂 token 需要的模型容量不一样同构专家很难适配不同难度样本参数利用效率低。核心方案 HMoEFFN 专家采用异构尺寸专家网络大小各不相同具备不同模型容量。支持 Top‑K固定激活专家数量、Top‑P动态自适应激活专家数量两种路由复杂 token 分配到大容量专家简单 token 分配小容量专家。专门设计训练损失提升小专家被激活概率缓解异构专家带来的激活负载不均衡。实验效果同等激活参数量下相比传统同构 MoE 获得更好语言建模性能同等性能下降低计算 FLOPs。定位Transformer FFN 层架构创新改变专家本身网络大小异构专家原生模型架构。3. BrownoutMoE: Structure‑Aware Expert Grouping for Efficient and Accurate LLM Web‑based ServicesarXiv:2607.04164面向结构感知的专家分组实现高效且准确的基于 Web 的 LLM 服务arXiv问题背景MoE 在线 Web 服务存在专家访问严重倾斜少量热专家处理绝大多数 token大量冷专家极少被调用GPU 利用率低。之前 BrownoutServe 采用按索引顺序简单合并专家为联合专家 (united expert)会把行为差异大专家合并蒸馏后精度损失大。核心方案 BrownoutMoE面向线上推理服务系统优化离线对原始专家做分组合并蒸馏在线做 SLO 感知动态降载brownout 降压保供范式。将分层专家分组建模为离散策略优化问题使用GRPO 强化学习搜索最优分组初始化依靠专家输出相似度层次聚类优先把行为相似专家划分同一组。两阶段流水线GRPO 搜索分组策略 → 分组一致知识蒸馏得到可部署联合专家模型。控制平面 SLO 感知延迟控制器线上根据 P90 延迟动态调整阈值冷专家 token 可路由到蒸馏后的联合专家牺牲少量精度保障响应时延 SLO。实验效果对比顺序分组基线精度退化最高减少 71.4%吞吐最高提升 2.24×基于 Qwen1.5‑MoE‑A2.7B 验证。定位MoE 推理服务系统优化不修改原生 MoE 网络结构后处理方式对已有训练完成 MoE 模型做专家合并蒸馏面向 Web 线上部署。三篇论文关键差异总表表格论文优化对象创新层面是否修改原生模型架构核心技术目标收益mixSGAAttention 注意力层 KV 缓存模型架构✅修改注意力模块异构分组注意力专家、token‑wise 路由、权重共享降低 KV Cache 内存开销HMoEFFN 专家网络模型架构✅修改 FFN 专家尺寸大小异构 FFN 专家、异构路由损失提升参数利用率、降低 FLOPsBrownoutMoEMoE 推理部署服务系统 后训练蒸馏❌不改动原生模型离线做专家合并蒸馏GRPO 专家分组搜索、联合专家蒸馏、SLO‑aware brownout 控制提升线上推理吞吐保障服务时延 SLO控制精度损失补充区分要点mixSGA 把 MoE 思想迁移到注意力HMoE、BrownoutMoE 聚焦传统 FFN MoEHMoE 是训练阶段原生异构专家架构BrownoutMoE 是对已经训练好的 MoE 做后处理属于服务侧优化BrownoutMoE 继承 BrownoutServe 的联合专家与 brownout 降载思想解决它顺序分组带来精度损失的短板。
返回列表