ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

小米MiMo大模型一年狂飙之路,罗福莉晋升小米22级

小米MiMo大模型一年狂飙之路,罗福莉晋升小米22级 文章目录前言01、一切的起点7B 小模型1.1 预训练里塞了个嘴替模块1.2 7B 的数学成绩单1.3 多模态三连02、V2-Flash骨架就这么定的2.1 数字先报一遍2.2 注意力怎么排大部分看眼前少数看全局2.3 训练方法一个学生一群老师2.4 让 Agent 在真实环境里挨打03、V2-Pro 到 V2.5参数和上下文一起起飞3.1 V2-Pro匿名马甲上线3.2 V2.5原生全模态 1M 上下文04、V2.6把 RL 训练搬进直播间4.1 训练也能直播4.2 两个关键设计4.3 不同的任务分开来练4.4 效果拉满还送周边05、HySparse2给 KV Cache 减负5.1 为什么要换5.2 上一代KV Cache 先减 10 倍5.3 HySparse2切两段共享两级5.4 挑 token 的方式也改了06、MiMo Code会自己写代码的 Agent6.1 一行命令装好6.2 主打长程任务6.3 四层记忆6.4 Max Mode5 个方案自己挑6.5 Dynamic WorkflowAI 给自己写代码6.6 0.1.15串行才是王道07、MiMo Desktop全能型数字实习生endingP.S. 无意间发现了一个巨牛的人工智能教程非常通俗易懂对AI感兴趣的朋友强烈推荐去看看 传送门https://blog.csdn.net/HHX_01前言大家好。今天聊个让人血压波动的消息小米 MiMo 大模型团队的负责人罗福莉晋升到了 22 级。22 级啥概念小米职级的天花板。再往上估计就是雷总亲自倒茶这种隐藏成就了。看到这儿我低头反思了三秒人家 31 岁升到公司最高职级我 31 岁还在为外卖凑单算满减。这差距比我家网速和 MiMo 训练速度之间的差距还大。说回正事。从罗福莉 2025 年 11 月官宣加入小米到这次晋升满打满算不到 11 个月。11 个月能干啥够我卸载 30 次 VS Code够我报一门瑜伽课然后只去一次。而她带团队把这 11 个月用成了从 7B 小模型一路干到万亿参数9 月 22 号开源的 MiMo-V2.6-Pro 直接在第三方评测机构 Artificial Analysis 的智能指数上拿了开源权重第一名。更离谱的是这版模型的 RL 训练过程是全程直播的——对你没看错训练也能直播弹幕选手已经就位。我今天就把这条线从头捋一遍一支团队是怎么在一年里把模型、训练、架构、产品一件件码出来的。看完你可能会发现它的完成度比你 2026 年的年度计划还高。01、一切的起点7B 小模型先说入坑姿势。MiMo 的第一个模型是 2025 年 4 月底开源的 MiMo-7B70 亿参数的稠密模型MIT 协议随便拿去商用那种。70 亿参数是什么体量我对着这个数数了半天零确认没数错之后低头看了眼我那 8GB 内存的电脑——它已经开始抖了。1.1 预训练里塞了个嘴替模块技术报告arXiv 2505.07608里写得明明白白预训练用了大约 25T token模型里塞了个多 token 预测MTP模块。多 token 预测翻译成人话就是以前的模型一次只说一个词现在一口气能说出后面好几个。你细品像不像你身边那种你一开口他就知道你要说啥还能替你补完下半句的朋友吵起架来体验极差但他预测你要加班倒是从来没失手过。1.2 7B 的数学成绩单经过 RL 训练的 MiMo-7B-RL成绩单是这样的AIME 2024 考了 68.2AIME 2025 考了 55.4MATH-500 考了 95.8。等一下AIME 2025 反而比 2024 低这味儿太熟了——每年出题组都会微调难度模型表示“不是我不努力是这届题太难了。”不过 5 月 30 号更新的 0530 版本又把 AIME 2024 拉到了 80.1算是一雪前耻。1.3 多模态三连接下来半年团队在 7B 这个尺寸上开始整活。5 月 30 号开源视觉语言模型 MiMo-VL-7B9 月 18 号开源 MiMo-Audio-7B预训练用了超过 1 亿小时的音频数据——1 亿小时就算从你出生那年开始 24 小时循环播放也才刚够零头11 月 19 号又放出 MiMo-Embodied-7B同时面向自动驾驶和具身智能。多模态全家桶视觉、听觉、身体全占了。我愿称之为三好学生配置德智体美劳就差个体育老师给它发奖状了。而 MiMo 第一次做到几百 B 的规模是 2025 年 12 月的 V2-Flash。这就到了故事的重头戏。02、V2-Flash骨架就这么定的2025 年 12 月 16 号小米开源 MiMo-V2-Flash。第二天罗福莉就在小米人车家全生态合作伙伴大会上做了演讲——这是她第一次以 MiMo 负责人身份公开亮相。入职一个月直接上台属于是把新人免培训写在简历上的那种。2.1 数字先报一遍V2-Flash 是个混合专家MoE模型总参数 309B但每处理一个 token 只激活 15B。上下文 256K预训练用了 27T token。总参数 309B、只激活 15B这配置让我想起某些公司编制上写着 300 号人干活的时候永远只有那 15 个老实人。效果嘛大家也看到了。成绩方面SWE-Bench Verified修复真实 GitHub issue 的编程评测拿了 73.4AIME 2025 是 94.1。写代码和考数学两开花比我又会写代码又会算满减强多了。2.2 注意力怎么排大部分看眼前少数看全局这一版最值得研究的是注意力的排布。模型一共 48 层其中 39 层是滑动窗口注意力SWA——每个 token 只看自己前面最近的 128 个 token剩下 9 层是全注意力——每个 token 要把前面所有内容都看一遍。小米管这叫混合滑动窗口注意力Hybrid SWA。为啥这么设计全注意力看得全但上下文一长计算越来越慢KV Cache 占的显存也越来越多滑动窗口只看一小段又快又省。所以大部分层用滑窗、少数几层看全局就是在速度和效果之间踩平衡木。这排布像极了上学时的我平时只记工位方圆两米内的八卦期末考试前一周才突击全科重点——最后居然还考得不错。这套结构后来一路用到了 V2.6。2.3 训练方法一个学生一群老师训练方法上V2-Flash 用的是多教师在线策略蒸馏MOPD。做法分三步先做监督微调SFT再为代码、搜索等不同领域分别训练教师模型最后让学生模型自己生成回答由教师模型在每个 token 上打分作为学生的奖励。翻译成人话让一个学生同时跟好几个老师学每说一句话老师当场打分。这不就是甲方爸爸的日常区别是学生真的越学越好而甲方的需求真的每天在变。2.4 让 Agent 在真实环境里挨打Agent 能力要靠 RL 环境练出来。真实环境里的代码 Agent 任务有 9 万个搜索任务 15 万个通用任务 5 万个。代码任务总数超过 10 万个跑在 Kubernetes 上同时运行的 pod 超过 1 万个环境搭建成功率 70%覆盖 8 种编程语言。1 万多个 pod 同时跑——我第一次看到pod这词第一反应是咖啡胶囊第二反应是原来 AI 也有提神需求。03、V2-Pro 到 V2.5参数和上下文一起起飞2026 年 3 月 19 号小米一口气发了三个模型MiMo-V2-Pro、MiMo-V2-Omni 和 MiMo-V2-TTS。3.1 V2-Pro匿名马甲上线V2-Pro 总参数超过 1T激活 42B总参数是 V2-Flash 的三倍多。1T 参数注意这个 T 是 Trillion 的 T不是我这辈子花出去的钱的那个 T那个 T 加起来可能也够呛。发布之前它用 Hunter Alpha 这个代号匿名挂在模型 API 聚合平台 OpenRouter 上全模态的 Omni 用的代号是 Healer Alpha。匿名挂上去干嘛摸底呗。就像有些人考雅思前先开小号裸考一次摸摸底考完发现裸考都有 7 分才放心报正赛。3.2 V2.5原生全模态 1M 上下文4 月 23 号 MiMo-V2.5 开始公测4 月 28 号开源还是 MIT 协议。V2.5 总参数 310B、激活 15B原生全模态。V2.5-Pro 总参数 1.02T、激活 42B一共 70 层60 层滑窗、10 层全注意力。两个模型的上下文都做到了 1M。1M 上下文是什么概念把《三国演义》全文塞进去还能再塞半本《西游记》陪你唠嗑。塞完之后它还记得开头的桃园三结义——这一点比我强我上周五中午吃的啥这周一就忘了。V2.5-Pro 在 SWE-bench Pro 上拿了 57.2Artificial Analysis 发布时给了 54 分和 Kimi K2.6 并列开源模型第一。从 V2-Flash 到 V2.5-Pro四个多月参数从 309B 干到 1T 以上上下文从 256K 干到 1M。然后MiMo 安静了将近半年。安静意味着在憋大招。程序员都懂键盘声最大的时候不是写代码的时候是思考的时候。04、V2.6把 RL 训练搬进直播间这半年憋的大招就是 V2.6 的 RL。4.1 训练也能直播9 月 17 号罗福莉发文说团队在研究强化学习RL到底能扩展到多远还把 V2.6 的 RL 训练做成了直播训练面板挂在 mimo.xiaomi.com/rl 上。把 RL 训练做成直播这操作我直接给满分。以前我们看主播打游戏现在看 AI 打参数。弹幕我都替观众想好了“这波梯度下降很稳”“预训练师傅好活儿”“前方高能loss 要起飞了”。9 月 22 号 V2.6 发布直播面板显示Pro 和 Flash 各训练了 75.3 万个样本。75 万个样本够我刷完整套行测了。4.2 两个关键设计V2.6 的 RL 有两个关键设计。第一多任务混合MixRL。一次 RL 训练里同时混进多个 Harness 的任务模型在同一轮训练里既要在编程 Agent 的环境里改代码也要在其他 Agent 环境里完成任务。翻译一边刷编程题一边做项目多线程打工卷王看了都沉默。第二奖励怎么给。V2.6 的奖励同时看测试用例和评分细则rubric。只靠测试用例的话所有通过的解法拿到的奖励都一样——写得好的和勉强凑合的分不出来。这就跟考试似的60 分和 100 分都是通过但 100 分显然更值钱。小米的办法叫分组 Agent 评分Groupwise Agentic Grading离线阶段把同一道题的多条 rollout 放一起对比自动生成评分细则在线阶段对通过测试的轨迹排序重新分配优势值advantage——也就是每条轨迹比同组平均水平好多少。翻译面试官把同一批候选人放一起矮子里拔高个儿再给高个儿单独加钱。通用 Agent 任务则拆成一条条原子化的二元评分项每项只判断是或否——简洁到连我的周报都不敢这么写。4.3 不同的任务分开来练不同的任务V2.6 分开练代码这类能自动验证、难度适中的任务放一起做混合 RL难以验证的、步数特别长的还有游戏、3D 这类单独训练最后用 MOPD 合并到一个模型里。整套训练还有个霸气名字“You Only RL Once”。翻译过来人生只 RL 一次就这一次梭哈。训练时冻结 MoE 的路由器决定每个 token 交给哪几个专家处理的模块——专家位置锁死不许换座位。4.4 效果拉满还送周边RL 前后的差距很明显编程 Agent 评测 DeepSWE 上Flash 从 48.8 提到 65.7Pro 从 58.4 提到 72.6。Artificial Analysis 智能指数 v4.3.2 给 V2.6-Pro 打了 46 分开源权重模型第一名。更良心的是小米还开源了 7000 个 RL 环境以及一个蒸馏到 Qwen 上的 9B 模型 MiMo-V2.6-Distill-Qwen-9B。9 月 27 号又补发 Pro-MOPD 和 Flash-MOPD 两个版本用来缓解工具调用重复的问题。开源才是真的爱。这一点希望某些只发 paper 不发代码的团队学一学。05、HySparse2给 KV Cache 减负9 月 23 号罗福莉发文说MiMo-V3 会换上新架构核心组件就是当天发布的 HySparse2。5.1 为什么要换因为 Agent 场景太畸形了模型动作很快但换回来的观察结果很长。模型输出一行命令工具可能返回几百行日志——这几百行日志都得先读进去。这不就是给领导发一条好的收到领导回你一篇 8000 字的论文你不但得读还得读完回一句收到谢谢领导。读进去这一步叫 Prefill预填充模型把输入从头读一遍给每一层建好 KV Cache。KV Cache 存的是每个 token 在每一层算出来的 K 和 V后面每生成一个 token 都要回头查它。说白了就是模型给每句话做笔记往后翻全靠笔记。输入越长Prefill 越慢KV Cache 越占显存。5.2 上一代KV Cache 先减 10 倍上一代的 HySparsearXiv 2602.03560名字取自混合稀疏注意力Hybrid Sparse Attention。在 80B 的 MoE 模型上49 层里只保留 5 层全注意力KV Cache 减少接近 10 倍。稀疏注意力除了看最近的一段还会从整段上下文里挑出最重要的一批 token 来看。KV Cache 减 10 倍省下的显存够我再开一个 Chrome 装满广告插件了。这么说吧程序员最感动的三个字永远是省显存。5.3 HySparse2切两段共享两级HySparse2arXiv 2609.263689 月 22 号提交在此基础上把模型切成前后两段前半段叫 Self-Decoder全注意力层和滑窗层混合和 V2 系列差不多。后半段叫 Cross-Decoder由一个个小模块组成每个小模块是一层全注意力后面跟几层稀疏注意力。切两段是为了做两级 KV 共享第一级在后半段的小模块内部叫 KV Reuse稀疏层直接复用本模块全注意力层的 KV Cache 和它挑出来的 token 名单自己不存 KV Cache。第二级跨越前后两段叫 KV Bridging后半段的全注意力层不用自己那一层的输入而是拿前半段某一层的隐藏状态来计算 K 和 V。KV Bridging 的思路来自微软研究院和清华 2024 年提出的 YOCOYou Only Cache Once。两级共享合在一起效果就是Prefill 跑完前半段就可以停。后半段的稀疏层不存 KV Cache后半段全注意力层的 K 和 V 又能从前半段算出来。工具返回的一大段日志进来只要过完前半段整个模型需要的 KV Cache 就齐了。你品品以前是每层都得存一份笔记现在是前面的人记好笔记后面的人直接抄。学术点叫 KV 共享通俗点叫传纸条。5.4 挑 token 的方式也改了上一代以 64 个 token 为一块整块挑HySparse2 改成逐个 token 挑。上一代的稀疏层还外挂一个单独的滑窗分支——这个分支要用后半段自己算出来的结果Prefill 就得把后半段也跑一遍HySparse2 取消了这个分支改成挑选时强制保留最近的 128 个 token。细节全在抠。这种优化思路让我想起那句经典省到就是赚到显存就像海绵里的水挤挤总是有的。06、MiMo Code会自己写代码的 Agent模型之外小米还自己做了一个 Harness叫 MiMo Code。6.1 一行命令装好2026 年 6 月 10 号MiMo Code V0.1 上线并开源MIT 协议一行 curl 命令就能安装具体命令以官方 README 为准# 一行命令安装地址以官方 README 为准curl-fsSL|bashMiMo Code 是开源终端编程 Agent OpenCode 的 fork多 Provider、终端界面TUI、语言服务协议LSP、MCP 这些能力都保留了下来。6.2 主打长程任务MiMo Code 主打长程任务long horizon——任务跑到几十步、上百步之后还能不出错。这能力比我在工位上坐一天不出错强多了我不出错但我摸鱼。上下文管理上它在上下文预算用到约 20%、45%、70% 的时候各设一个检查点checkpoint派一个独立的 writer Sub-agent 把当前工作状态写到磁盘上上下文快满时执行一次 rebuild开一个新窗口用写好的文件重建上下文。像极了我打游戏的自动存档越怕死存档越密。唯一区别是它存档是为了继续推进我存档是为了读档重来。6.3 四层记忆记忆分四层会话级是 checkpoint.md项目级是 MEMORY.md用户级是全局记忆最底层是用 SQLite 存下来的完整会话记录。另外还有两个定时任务dream 每 7 天合并一次重复的记忆distill 每 30 天把反复出现的流程整理成 Skill。7 天一次复盘、30 天一次总结这就是 AI 版的周报 月报啊。只不过我们人类通常坚持到第一周的周一然后就没有然后了。6.4 Max Mode5 个方案自己挑Max Mode 让模型每一步并行生成 5 个候选方案再由同一个模型当评委选一个执行。SWE-Bench Pro 上比单次采样高 10% 到 20%token 消耗是 4 到 5 倍——目前还是实验功能。体验加倍账单加倍这不就是买一送一的奶茶送的确实是送的但你以为的免费其实都在原价里。我要是点外卖有这个能力5 个都点然后选最好吃的……算了钱包先不同意。6.5 Dynamic WorkflowAI 给自己写代码任务再大一些Dynamic Workflow 让主 Agent 直接生成一段 JavaScript 脚本用 agent()、parallel()、pipeline() 三个函数派发 Sub-agent、控制并发在沙箱里按代码执行。示意代码如下// Dynamic Workflow 示意函数名来自官方文档描述constsubawaitagent(收集资料);const[r1,r2]awaitparallel(sub,分析数据,生成图表);constfinalawaitpipeline(r1,r2);AI 给自己写代码来调度别的 AI——这不就是我卷我自己的终极形态当年老板说要招一个能管理 AI 的员工现在 AI 自己就把这个岗位给顶了。6.6 0.1.15串行才是王道9 月 22 号0.1.15 版把同一步里的多个工具调用改成串行执行只有只读和检索类的工具可以并行还加了工具调用检测专门拦截短时间内大量涌出的工具调用。这规则我熟公司里能并行的只有摸鱼正经事一律排队。AI 终于学会了人类社会的高级生存法则。07、MiMo Desktop全能型数字实习生9 月 8 号小米开放桌面客户端 MiMo Desktop 的邀测核心引擎就是 MiMo Code。MiMo Desktop 能接收表格、图片、视频、PDF、录音——连未解压的压缩包都能直接丢进去交付的东西包括文档、表格、幻灯片、网页、图片、音频、视频还有 3D 模型、App 和软件工程项目。输入输出全家桶比我去自助餐厅拿的还全。我好歹还挑食它啥都吃吃啥都能消化成产物。它还能让多个 Agent 协作通过 MCP 控制 Figma也能自主操作浏览器。缓存命中率同一个会话里最高 99%跨会话最高 95%。我的输入法要有这个命中率我打字都不用看键盘了。可惜我的输入法连这个字和这个值都分不清。ending哦对了今年 7 月小爱同学调整架构之后基础模型也交给了 MiMo 团队。以后你喊小爱同学回你的可能是一段被 RL 调教过的哲学。不得不说AI 时代是真的快模型进化快、Agent 迭代快、人的晋升也快。唯一不变的是我还在原地以不变应万变——毕竟变的是参数不变的是我写稿子的手速。好今天就唠到这。觉得有用点个赞觉得没用也点个赞反正我又不能顺着网线去看你点了没。P.S. 无意间发现了一个巨牛的人工智能教程非常通俗易懂对AI感兴趣的朋友强烈推荐去看看传送门https://blog.csdn.net/HHX_01
返回列表