
一句话总结非营利机构 Ai2 于 10 月 1 日开源Olmo-core 3——一套重写过的 MoE混合专家训练系统8 张 B300 上吞吐约 2.7 倍于旧实现、512 卡验证 1.2 万亿参数模型、MXFP8 低精度再提速 21%。它不是新模型而是下一代 Olmo 的训练基座也是目前 Megatron-Core 之外少有的开放替代。先从一个扎心的现实说起大模型训练的成本曲线这几年基本把学术实验室挤出了牌桌——参数量上去卡和电费按亿美元计能玩万亿参数训练的只剩少数大厂。MoE混合专家架构总参数很大但每个输入只激活一小部分「专家」本来是省算力的希望但它有个隐蔽的坑专家越多把数据路由给正确专家的通信与调度成本越高省下来的算力红利又被吃回去。10 月 1 日Ai2 把补这个洞的整套方案开源了。想自己动手或查证 官方公告Hugging Face Blog · allenai/olmocore3 代码GitHub · allenai/olmo-core 技术报告allenai.org/papers/olmocore3 交互式讲解narrative.allen.ai/scaling-up-training先说清它是什么训练框架不是新模型容易混淆的点先澄清Olmo-core 3不是模型权重。Ai2 的 Olmo 系列里OlmoE 是 64 专家的 MoE 模型2025 年 11 月的 Olmo 3 反而转回了密集架构而 Olmo-core 3 是这一切下面的训练基础设施——下一代 Olmo 将确定采用 MoE 架构用 Ai2 最大的数据集和最长的上下文窗口训练栈就是这套新框架。也就是说这是一个「把方法先于模型公开」的发布万亿参数 MoE 怎么训牌先亮出来模型后到。关键数字2.7 倍吞吐是怎么来的上一代 Olmo-core 的 MoE 实现用 FSDP全分片数据并行每批数据都要把权重聚集再分片一遍批次一多搬运权重的开销就成了大头。Olmo-core 3 换成 DDP分布式数据并行思路专家常驻在各自的 GPU 上不动把数据路由过去。效果用一组受控对比说最清楚专家池从 8 个扩到 128 个每个 token 仍只激活 4 个专家单 token 激活参数稳定在约 32 亿——总容量从 46 亿拉到 470 亿10 倍训练吞吐却只下降不到 5%。在 8 张 NVIDIA B300 的初步测试中这个 470 亿参数的 MoE 跑到每卡每秒 52,000 token旧实现只有 19,400。这里需要澄清一句口径 trillion 级的数字来自「随机路由」的系统基准测的是基础设施性能而非训练出的模型质量512 卡跑通的 1.2 万亿参数模型每 token 激活 583.6 亿观测到最高每卡 858 TFLOP/s。数字是框架能力的天花板展示持续训练表现要看下一代 Olmo 的实际训练。三招拆分、三项优化、一个精度开关具体怎么把大 MoE 摊到集群上框架用了三层拆分加一组路由优化专家并行每张卡只存一部分专家池流水线并行把模型分层切给不同 GPU 组分布式优化器优化器状态不再每卡存全量副本。路由侧的省钱三件套行式专家并行把数据直接摆进专家输入缓冲区、GPU 常驻路由让 CPU 排活不用等元数据拷回、分组 GEMM 把小而多的专家计算合并批量执行。再叠加MXFP8低精度格式开关——4 卡受控测试里端到端吞吐比 BF16 高约 21%峰值活动显存从 103 GiB 降到 95 GiB收益主要来自前馈计算和专家间数据搬运而不是注意力。难得的是失败实验也一起交了技术报告里最有价值的部分恰恰是「试过但没采用」的路径一个本意鼓励负载均衡的评分可能在真实负载变得更不均衡时反而「变好看」——Ai2 称之为token gerrymanderingtoken 分配舞弊因为专家处理的 token 少就调低其学习率在测试的模型族里没有带来改善相同矩阵维度下GPU 计算耗时随输入数值变化性能对比必须对齐输入值与形状通信与计算分流重叠并不总能加速某些测试里反而拖慢端到端执行。对要自己搭训练栈的团队这些负结果可能比 2.7 倍的正面数字更省真金白银——别人踩过的坑直接绕开。这事跟你有多大关系分三类读者说要训而非微调大模型的实验室/团队这是目前 NVIDIA 生态里 Megatron-Core 之外少有的开放替代且经过 512 卡验证、连工程决策记录都公开。但注意门槛「有框架」不等于「训得起」——万亿参数的真实成本仍以亿美元计512 张 B300 本身就是多数团队的全部算力预算。️做推理/训练 infra 的工程师报告里关于通信重叠、精度格式、路由开销的实测结论直接可借鉴到自家系统的调优决策里。纯应用层开发者短期影响有限。间接影响是下一代 Olmo开源阵营里透明度最高的系列之一的成型速度以及「训练栈公共品化」这个行业趋势——同周 DeepSeek 开源了昇腾平台的六个训练组件两大生态在同一个星期把训练基础设施摆上了开源货架。把话说明白这次发布没有争议、数字口径也诚实官方自己标注了随机路由的测试性质真正值得玩味的是趋势——开放的边界从模型权重、数据配方推进到了训练基础设施本身。模型能力的差距会不会从「谁有钱」慢慢转向「谁会调」下一代 Olmo 出来之前这个问题没有答案但入场券确实发出去了。参考来源Ai2 官方公告一手Introducing Olmo-core 3 | Ai2 BlogHugging Face 同步发布一手HF Blog · allenai/olmocore3技术报告一手allenai.org/papers/olmocore3Unite.AI 行业报道Ai2 Releases Olmo-Core 3中文解读梭哈 AI · Ai2 开源 Olmo-core 3、Agent E 报告