行业资讯
人民大学与蚂蚁集团联手,将AI推理模型扩展到一万亿参数
这项由中国人民大学高岭人工智能学院与蚂蚁集团联合发起的研究于2026年7月发表论文编号为arXiv:2607.12395v1有兴趣深入了解的读者可通过该编号查询完整论文。研究团队还包括来自清华大学和浙江大学的学者合作阵容在国内AI研究领域颇为瞩目。如果你曾经见过一个孩子从完全不会下棋到仅凭大量自我对弈就成长为高手那你大概能感受到这篇论文想做的事情——只不过这里的孩子是一个拥有整整一万亿个参数的超大规模语言模型而下棋变成了解答复杂的数学竞赛题。研究团队将这套方法命名为Ring-Zero其中Zero的含义十分直白从零开始不依赖任何人类标注的解题过程只靠模型自己摸索、自己犯错、自己改正。这套方法在学术圈被称为零强化学习Zero RL。普通的AI训练往往需要大量人工标注数据比如专家一步步写出解题思路让模型照着学。而零强化学习完全跳过这个昂贵且费时的环节让模型像一个自学成才的学生给它一道题告诉它答对了就给奖励答错了就不给其余的全靠它自己琢磨。这种方法此前已有研究者尝试过但绝大多数实验都局限在规模相对较小的模型上。本文的核心贡献在于将这一训练范式推进到了前所未有的一万亿参数量级并系统性地记录了在这个尺度上发生的种种奇特现象。结论相当震撼当模型足够大它会自发学会人类研究者费尽心思才能教给小模型的高级思维策略包括分步骤整理推理过程、主动验证自己的答案、同时探索多种解题路径等等。一、为什么一万亿参数是个大事在讨论研究细节之前有必要先把一万亿参数这个数字具体化。参数粗略地说就是模型在训练过程中学习到的经验值数量越多模型能记住的知识和掌握的推理能力理论上也越强。人类大脑的神经突触连接数量大约在百万亿量级而目前主流的大语言模型通常在数百亿到数千亿参数之间。Ring-Zero所用的基座模型 Ling-2.5-1T-Base 拥有一万亿参数虽然通过混合专家架构可以理解为模型内部有很多专科医生每次只调用其中少数几位而非全体出动让实际运算时激活的参数量约为630亿但总体规模依然远超大多数公开模型。为了做对比研究团队同时训练了一个1040亿参数的闪速版模型 Ling-2.5-flash-Base激活参数约74亿。两个模型用完全相同的训练方法跑了同样的流程最终结果清晰地说明了规模的力量在相同训练步数下万亿参数模型的数学竞赛得分远高于千亿参数模型而且提升速度更快——也就是说同样学习一道题大模型能从中获得更多收益。这一发现印证了AI领域一个颇具争议的观点研究者称之为苦涩的教训历史上无数精心设计的人工规则和工程技巧最终都败给了更大的计算规模和更多的数据。这次实验再次为这个教训提供了有力佐证。二、训练这个巨兽的四步菜谱把一个什么都不会的基座模型训练成能解答数学竞赛题的推理高手研究团队设计了一套四阶段流程就像一套精心排序的烹饪步骤每一步都有其不可替代的作用。第一步是唤醒推理本能。刚出炉的基座模型就像一个读了大量书籍但从未考过试的学生——它知道很多知识但不习惯一步步写出解题过程。这个阶段的目标就是强迫它养成这个习惯。训练方式是给它出题让它生成16个不同的答案然后根据答案是否正确给予奖励。为了让模型愿意尝试那些它本不擅长的长思路解题方式团队使用了一种叫做裁剪重要性采样策略梯度的技术——用更直白的话说就是专门放大那些模型平时不太会走但走对了的解题路径上的学习信号鼓励模型多探索这些少走的路。与此同时训练初期还用了一个按词计奖而非按题计奖的评分方式。正常情况下不管答案写了多长最终奖励都是固定的。但按词计奖意味着答案越详细、推理过程越长积累的学习信号越多。这就像鼓励学生在考试中把解题过程写得越详细越好——初期对于建立推理习惯非常有效。为了防止模型跑偏太远研究团队还加了一个KL散度惩罚机制可以理解为给一根弹性绳模型可以偏离原来的风格但橡皮绳会防止它完全变成另一个样子。这根绳子至关重要实验证明一旦去掉它模型的训练在几百步后就会完全崩溃。第二步是自我精简与重置。经过第一阶段的训练模型确实学会了推理但推理过程往往啰嗦至极——反复验算同一个步骤、绕圈子、说废话。更麻烦的是由于训练用的计算引擎和推理时用的计算引擎在底层实现上有微小差异长时间训练后这种误差会越积越大最终导致训练崩溃。于是团队祭出了自我蒸馏这一招用已经学会推理的专家模型生成大量答案从中挑出最短的正确答案再让模型对这些答案做一轮自我检查把冗余部分去掉最后把精简后的优质答案反过来喂给原始基座模型重新学习。这一步相当于回炉重造既保留了推理能力又把冗余和误差一并清除为后续训练提供了一个干净的起点。第三步是持续稳定优化。自我蒸馏之后模型进入第二轮强化学习。这一轮的关键变化是把奖励的计算方式从按词计奖改为按题计奖——不管答案写了多长奖励总量相同。这一改动立竿见影模型不再有写长了就能多得分的动机输出长度趋于稳定训练也更加平稳。同时这一阶段去掉了第一阶段的KL惩罚绳子——因为自我蒸馏后的模型已经足够稳定无需再限制它的探索空间。第四步是按难度分级训练。经过前三个阶段模型的推理能力已经相当可观但它存在一个问题无论面对什么难度的题目都用差不多相同的篇幅来作答。简单的问题不需要长篇大论复杂的问题则可能需要深度思考。于是研究团队把训练题目分成简单、中等、困难三个档次分别配上最大4千、1.6万、6.4万词的篇幅限制并用不同的系统提示语告诉模型当前面对的是哪个档次。模型在这种训练下逐渐学会了按需分配简单题快速作答复杂题深思熟虑。三、让万亿参数模型稳定运行的工程魔法把如此庞大的模型投入强化学习训练工程难度堪比在高速公路上为一辆行驶中的火车换轮子。研究团队在系统层面做了两项关键改造缺少任何一项整个训练都会在数百步内崩溃。第一项是混合精度控制。现代AI训练通常使用一种叫BF16的低精度数值格式可以节省大量显存和计算资源。但低精度意味着数值计算有细微误差。在强化学习中有一个关键计算叫做重要性采样比简单说就是比较现在的模型和生成答案时的模型在同一个词上的概率差异。这个比值对精度极为敏感——一点点数值误差经过指数运算软最大值函数内部会做指数运算会被无限放大最终导致训练信号失控。研究团队的解决方案是大部分计算继续用BF16节省资源但注意力计算中的软最大值函数和最后的词汇概率输出层改用FP32高精度计算。这个精准点穴式的优化以很小的额外开销换来了训练稳定性的大幅提升。第二项是上下文并行优化。当单个问答的文本长度达到数万词时一台GPU根本装不下整个序列必须把序列分割到多台GPU上并行计算这就是上下文并行技术。常规的做法称为环形注意力是让每台GPU依次从相邻GPU拿数据、计算、再传给下一台就像一群人围成圈子传接力棒。但当GPU数量增多时这条接力链变得很长每台GPU都需要等前面所有人传完才能开始效率极低。研究团队针对所用模型的混合架构做了定制化优化对于MLA注意力层改用全对全通信策略所有GPU同时交换数据各自独立完成计算无需排队等待对于闪电注意力层则用一次全收集操作广播给所有GPU立即开始计算。这些改动在数学上完全等价但效率大幅提升。全部实验在320块H200 GPU上完成。四、训练过程中意外发现的两段式成长规律在记录训练数据时研究团队发现了一个耐人寻味的现象直接触及AI研究界长久以来的一个争论强化学习到底是真的在拓展模型的能力边界还是仅仅在把模型本来就会的东西调得更稳定为了回答这个问题研究者在训练过程中同步追踪了两个指标。一个是pass1即模型随机给出一个答案时的正确率反映的是稳定发挥的水平。另一个是pass1024即让模型连续生成1024个答案只要其中有一个答对就算成功反映的是能力上限——模型到底知不知道这道题的解法哪怕只有极小概率能说对。实验结果清晰地描绘出两个阶段。训练初期pass1024明显上升说明模型确实在发现新的解题路径有些题目原来1024次尝试都答不对现在终于能答对了——这是真实的能力拓展。但到了训练中后期pass1024趋于平稳不再上升而pass1则持续提高。这说明此时模型已经摸到了能力天花板但还在练习如何更稳定地触及这个天花板——从偶尔灵光一现变成每次都能答对。用一个形象的比方前期是学新技能后期是把学会的技能练到炉火纯青。这个发现调和了学界此前的争论指出两种观点都是对的只是对应训练的不同阶段。五、一万亿参数模型自发涌现的五种高级思维这是整篇论文最令人惊叹的部分。研究团队在检查模型生成的推理过程时发现了五种没有人教过它的行为全部是自发出现的。第一种是拟人化表达。模型在解题遇到困难时会自然地流露出类似人类的情绪反应。比如发现自己之前的推导有误时会写出Wait, but I might have a brain fart here等等我这里可能犯了个低级错误在完成一个巧妙解法后会出现Genius Idea绝妙点子或nailed it搞定了这样的自我褒奖。研究团队认为这些表达来源于预训练数据中大量的网络论坛和人类思维记录模型不仅学会了数学逻辑还学会了人类解题时的心理历程。第二种是结构化格式。在没有任何格式指令的情况下模型自发地把推理过程组织成第一步……第二步……的清晰格式就像一篇写给别人看的详细解题报告。研究团队指出这种结构化行为背后有一个深层原因把注意力分配到清晰的逻辑块上有助于模型自身更好地记住前面推导的结论从而减少错误。换句话说有序的格式不是炫耀而是模型自己发现的、帮助自己思考的工具。第三种是并行推理。面对复杂问题时模型会在同一个线性回答流程中主动尝试多条解题路径。比如在解完一种方法后会写Alternative approach: Another way to think about this problem is...另一种思路这道题也可以这样考虑……然后自己把多条路径的结论对比只在多个方法都指向同一答案时才最终确认。这相当于在脑子里同时开了好几个计算线程用最终的交叉验证来保证结论的可靠性。第四种是自我验证。模型在得出候选答案后不会直接停笔而是主动回到原题检验把结果代入原方程看是否成立与已知公式比对或寻找能反驳自己的反例。用论文中的案例来说在计算一个水平放置圆柱体的液体体积时模型在给出积分结果后额外用另一种公式交叉验证并写下all methods agree所有方法结论一致才最终确认答案。第五种是上下文焦虑。这是五种行为中唯一带有缺陷色彩的一种但研究团队认为它同样折射出模型高度的策略意识。当模型感知到自己已经用掉了大部分可用词数、离截止点越来越近却还没得出答案时它会主动放弃正在进行的复杂推导转而给出一个有根据的猜测并明确写明理由比如Given the time Ive invested and the ambiguity, I will proceed to make an educated guess鉴于我已经花了很多时间且题目存在歧义我决定给出一个有根据的猜测。这种行为说明模型深度理解了训练中的奖励规则回答格式不完整得零分而给出一个猜测至少有一定概率得分。于是在资源耗尽前它选择了最大化期望回报的策略。值得强调的是研究团队在1040亿参数的小一些的模型上做了同样的训练发现这些行为在小模型上并不能自发出现——为了让小模型产生结构化格式或自我验证行为必须专门设计额外的奖励规则。而万亿参数模型在没有任何这类规则的情况下自发习得了全部五种策略这正是苦涩的教训在本研究中最直观的体现。六、如何衡量推理质量而不只看对错传统的AI评测方法只看最终答案对不对忽视了推理过程本身的质量。研究团队认为这远远不够于是提出了一套从三个维度评估推理链质量的框架。第一个维度是可理解性即人类读者能否顺着模型的推理思路、不觉费力地理解全过程。评测方法是让另一个大模型充当裁判将Ring-Zero的推理链与其他模型的推理链进行两两比较判断哪个更清晰、逻辑更连贯、更少出现无中生有的错误断言。在AIME竞赛题的90道题目上Ring-Zero对阵四个业界顶尖模型包括GLM-5.1、Kimi K2.6、MiniMax M2.7和Qwen3.5-397B胜率压倒性领先最低胜率也达到64%。第二个维度是可复现性即其他人或弱一些的模型能否通过阅读这份推理记录、学到解决类似问题的通用方法。评测方式是把Ring-Zero生成的推理链作为训练数据教给两个能力较弱的模型Qwen2.5-32B和Llama3.3-70B看它们的能力提升幅度。结果显示仅用10万条Ring-Zero的推理数据训练出的学生模型在数学竞赛上的得分比用DeepSeek-R1的80万条数据训练出来的学生模型还高——Qwen2.5-32B提升了5.8个百分点Llama3.3-70B提升了4.5个百分点。这意味着Ring-Zero的推理过程包含了密度更高、更容易迁移的解题智慧。第三个维度是效率即模型能否用尽可能少的词数得出正确答案不说废话、不绕弯路。评测方法是找出所有五个模型都答对的题目比较各自推理链的平均词数。Ring-Zero平均只用6368个词而其他四个模型的平均词数都在14000到17000之间。同样答对一道题Ring-Zero的推理链长度不足竞争对手的一半。七、数学竞赛成绩单研究团队在七个高难度数学竞赛基准测试上评估了Ring-Zero包括AIME 2024、AIME 2025、AIME 2026、HMMT February 2025、HMMT November 2025、HMMT February 2026和IMOAnswerBench。这些都是真实竞赛题目难度相当于美国高中数学奥林匹克至国际数学奥林匹克的水平普通人见了大概头皮发麻。仅靠第一阶段强化学习训练出的Ring-2.5-1T-Zero在AIME 2026上就达到了84.2%的正确率。经过完整四阶段训练之后最终版本在AIME 2024上达到94.1%AIME 2025达到92.3%AIME 2026达到93.2%HMMT Feb 2025达到90.6%HMMT Nov 2025达到90.8%HMMT Feb 2026达到81%。这些成绩与当前业界顶尖的专有商业模型GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.8等处于相近水平而Ring-Zero完全不依赖人工标注的推理数据。三档推理模式低档4千词预算、中档1.6万词预算、高档12.8万词预算的对比结果说明了一个实用价值面对不需要深度推理的简单问题低档模式以平均仅2353词的推理长度给出答案速度和成本大幅降低而中档模式在保持相当竞争力的同时词数也远少于高档模式。用户可以根据实际需求灵活选择。八、一些值得警惕的发现研究团队也坦诚记录了训练过程中发现的问题和局限。一个叫做长度惯性的现象颇为有趣。按词计奖的训练方式确实让模型学会了写长推理链但同时也让模型养成了一个坏习惯即便面对它早已能轻松答对的简单题随着训练推进它的答案长度也会不断增加。研究团队专门追踪了那些第一次就答对的简单题发现随着训练步数增加这些题的回答长度依然在增长——模型并非因为题目变难才写更多而是单纯地学会了写多一点总是更保险的懒惰策略。两种不同窗口大小1.6万词和3.2万词的对比实验也证实了这一点给更大的窗口模型就把整个窗口填满但答题质量几乎没有提升。这正是三阶段引入按题计奖和自我蒸馏的原因。训练数据的分布也是一个重要发现。现实世界的数学题难度分布呈长尾状——大量简单题少量难题。但研究团队发现按照这个自然分布训练对模型没有好处甚至会拖慢进步。简单题对于一个已经具备一定推理能力的模型来说几乎无法提供新的学习信号反而浪费了宝贵的计算资源。高效的训练需要动态调整数据难度随着模型能力增强不断提供更有挑战性的题目。这个结论对于设计大规模AI训练课程有很强的参考价值。此外研究团队也明确指出了零强化学习的天花板它只能发掘预训练时已经学到的知识无法凭空创造新的数学定理或证明技巧。如果某个数学概念在预训练数据中完全缺席再强的强化学习也无法让模型掌握它。说到底这项研究最深刻的价值可能不在于它创造了多高的数学竞赛成绩而在于它系统性地证明了当模型足够大、训练足够充分时许多人们原以为需要精心设计和手动注入的聪明行为会作为副产品自然涌现出来。这对整个AI研究领域的方向选择都有重要启示——与其投入大量精力设计各种人工规则和特殊奖励不如把资源放在更大的模型和更稳定的训练基础设施上。当然这也意味着计算资源的门槛越来越高能够复现或推进这类研究的团队将越来越少。有兴趣深入了解全部技术细节的读者可以通过arXiv编号2607.12395查阅完整论文。QAQ1零强化学习Zero RL和普通的AI训练有什么区别A普通AI训练通常需要大量人工标注数据比如专家写好解题过程让模型照着学。零强化学习完全跳过这个环节模型只从一道题答对或答错的结果中自己摸索无需任何人工示范。Ring-Zero就是用这种方式在没有人工标注的情况下从零训练出了能解答数学竞赛题的推理能力。Q2Ring-Zero的五种涌现行为是什么意思为什么重要A涌现行为是指模型自发学会的、没有人教过的技能。Ring-2.5-1T-Zero在训练后自发出现了五种像人一样表达情绪、自动整理推理步骤、同时探索多种解法、主动验证答案、以及在词数快用完时改为猜测。这些行为在较小的模型上不会自然出现说明足够大的模型规模本身就能解锁复杂思维策略不需要额外规则来强制引导。Q3Ring-Zero的推理过程为什么比其他顶尖模型用的词少很多A因为训练流程中有一个自我蒸馏环节专门把冗余的推理步骤去掉让模型学会走最直接的逻辑路径。同时后期训练把奖励方式从按词计分改为按题计分消除了模型写越多得越多的动机。最终Ring-Zero解同一道题平均只用约6400词而其他模型通常需要14000到17000词。
郑州网站建设
网页设计
企业官网