
这个问法里其实压了两次跳跃,我想先把它掰开。第一跳是"0731 确实压住了 Pro",这一跳基本成立,官方自己放的九张 agent 榜上 Flash 都比 Pro 预览版高。第二跳是"压住 Pro 就说明参数没用",这一跳我不认,我觉得它更像先射箭再画靶。真正要紧的是 0731 这次发布里最容易被跳过的一句话:架构和参数规模都没动,只重做了后训练。也就是说它和四月的预览版共享同一套预训练权重,改的只有后训练管线。它无意中成了一个挺干净的对照实验——把"底"按住不动,只动后训练,看能挪出去多远。结果挪得很夸张。Terminal-Bench 2.1 从 61.8 干到 82.7,DeepSWE 从 7.3 干到 54.4,后者是七倍多。一个没换骨架、没加参数的模型,光靠重做后训练,agent 分数是这么抬上去的。这件事的第一层含义,跟"参数没用"恰好相反。它说明我们现在做横向比较的时候,比的常常不是参数。Pro 预览版和 Flash-0731 摆在同一张榜上,前者输,输在它的后训练没做到 0731 这个程度,而不是输在它多出来的那 1.3T 参数是负担。这个坑 Chinchilla 那篇踩过一次。当年所有人拿 Gopher 的 280B 跟一堆小模型比,说参数就是一切,直到 Hoffmann 他们把训练 token 数这个变量控制住,才发现同样算力预算下 70B 的 Chinchilla 能压住 280B 的 Gopher,而且是在数据多了四倍多的情况下。教训是同一个:不把"训练量"这条轴按住,任何关于参数规模的结论都是悬空的。今天这条轴换了个名字,叫后训练。所以我并不反对"底大一级压死人"这个结论,我反对拿 0731 去当它的证据。0731 证明的是后训练这条轴上还有天量的空间没被吃掉,不是参数这条轴到头了。这两件事经常被并成一句话讲,但它们指向的下一步动作完全相反——前者让你去修数据管道,后者让你去加卡。那"底大"的手感又确实不是幻觉,它到底从哪来?我的理解是:它来自预训练权重里那份先验,而后训练动不了先验。有个实验能把这条界线画得挺清楚。Yue 他们那篇讲 RLVR 的论文,用 pass@k 去测 base 模型和它