行业资讯
大模型的能力评测——Benchmark 是什么、怎么测、能信吗?
副标题每个新模型发布都自带一张跑分表MMLU 94%、SWE-bench 88.6%、C-Eval 93%……但这些数字到底代表什么同样的模型为什么在不同榜单上位置不一样看懂 Benchmark是选模型的起点。一、一个经典困境你刷到一条新闻“GLM-5.2 发布MMLU 达到 94%超越 GPT-5.6 Sol 了”往下翻评论区“才 94%Claude Fable 5 都 91.5%MMLU-Pro凭什么说全面超越”“MMLU 早就饱和了谁还看这个啊”“得看 SWE-benchGLM 的 SWE-bench Pro 是 62.1%”“等等它家自己发的 94% 是 5-shot CoT 还是 zero-shot评测设置不一样分数完全不同”一头雾水。这不是你的问题——大模型评测本身就是一个已经变得极其复杂的领域。几十个 Benchmark、不同的评测设置、不同的版本MMLU 还是 MMLU-Pro、数据污染问题……如果你是第一次认真看这些数字看不懂是正常的。这篇文章的目的就是把大模型评测这件事彻底讲透。你看完以后不仅能看懂任何一份模型评测表还能判断哪些数字值得信、哪些只是营销。二、Benchmark 到底是什么Benchmark 一套标准化测试题 一套评分规则。它解决的问题很简单没有统一的考试你怎么知道 A 模型比 B 模型强类比高考高考分数不能完全代表一个人的能力——但它是大学招生的统一标尺没有高考每个大学自己面试录取效率极低且无法横向比较大模型的 Benchmark 也是同样的角色——它不完美但没有它模型的强弱就是各说各话。一个好的 Benchmark 需要三点区分度弱模型低分、强模型高分能拉开差距可复现同一模型跑同一套题结果应该差不多temperature0 时抗污染测试题不应该出现在训练数据里——否则模型不是会是记得三、评测维度大模型的能力可以拆成哪些方向一张总览表对应后面的详细展开能力维度代表 Benchmark测什么饱和了吗知识广度MMLU → MMLU-Pro57 学科模型是否博学MMLU 已饱和MMLU-Pro 仍有区分度数学推理GSM8K → MATH → AIME数学从算术到竞赛GSM8K 已饱和AIME 仍有挑战代码生成HumanEval → SWE-bench从写函数到修 BugSWE-bench 还在拉开差距复杂推理BBH / GPQA Diamond博士级科学推理前沿 60-90%区分度好中文能力C-Eval / SuperCLUE中国教育体系下的知识榜首 90-94%有污染问题长上下文Needle-in-a-Haystack / RULER百万 token 中的精准检索大部分模型做得不错但不完美对话体验Chatbot Arena人类盲评看谁更会聊天永远有区分度——用户口味不同Agent 能力SWE-bench / Terminal-Bench多步工具调用新兴领域差距明显四、主流 Benchmark 详解含题目示例4.1 MMLU / MMLU-Pro知识量的高考MMLUMassive Multitask Language Understanding是目前引用最多的大模型知识评测57 个学科、约 14,000 道选择题覆盖人文、社科、理工、医学、法律等。题目长什么样学科大学物理College Physics一个电子在均匀电场 E 中从静止开始加速。经过距离 d 后它的动能是多少A. e E dB. e E / dC. e d / ED. ½ e E d²学科美国法律Jurisprudence下列哪个是英美法系中stare decisis原则的核心含义A. 法官可以自由裁量B. 上级法院的判决对下级法院有约束力C. 陪审团决定事实问题D. 判例法可以随时推翻从 MMLU 到 MMLU-ProMMLU 的 4 选 1 格式对今天的前沿模型来说太容易了——最先进的模型普遍 90%1-2 个百分点的差异在统计上不显著。MMLU-Pro 做了三件事升级4 选 1 → 10 选 1猜对概率从 25% 降到 10%增加了更多推理型题目减少记忆就能答对的题去除了质量低的题目总题量缩减到 12,000同样的物理题在 MMLU-Pro 里可能变成一个电子在均匀电场 E 中从静止开始加速经过距离 d 后进入一个垂直于运动方向的匀强磁场 B。求电子在磁场中的回旋半径。A. mE/(eB²d)B. √(2mEed)/(eB)C. √(2mE)/(eB) · √dD. √(2mE)/(Be)⁰·⁵E. 2mE/(eBd)F. eB√(2mEd)G. √(2mEed)/BH. m√(E/(eB))·dI. 以上都不对J. 条件不足无法计算难度明显上升——10 个选项里只有 1 个对的模型必须真正理解物理过程不能靠排除法。2026 年前沿数据模型MMLUMMLU-ProClaude Fable 5—91.5%Claude Opus 4.892.1%89.5%GPT-5.6 Sol——Gemini 3.1 Ultra90.4%89.8%Qwen3.7 Max—89.6%DeepSeek V487.2%—GLM-5.287.3%86%4.2 GSM8K / MATH / AIME数学能力的三级跳大模型的数学评测有清晰的难度阶梯GSM8K小学 → MATH竞赛预科 → AIME / FrontierMath天才级第一级GSM8KGrade School Math 8K8,500 道小学数学应用题要求写出推理过程后再给答案。典型题目蛋糕店上午卖出 23 个蛋糕每个售价 12 元。下午卖出的蛋糕数量是上午的 2 倍每个售价降价 2 元。问全天总收入是多少模型需要输出上午收入 23 × 12 276 元下午数量 23 × 2 46 个下午单价 12 - 2 10 元下午收入 46 × 10 460 元总收入 276 460 736 元这道题对前沿模型已经是送分题了。2026 年所有主流模型 GSM8K 都 95%o3-pro 甚至达到 99.1%。第二级MATHMathematics Aptitude Test of Heuristics12,500 道竞赛级数学题难度对标美国 AMCAmerican Mathematics Competitions。典型题目在等差数列中第 5 项是 17第 9 项是 29。求前 12 项的和。模型需要设首项 a₁公差 d。a₅ a₁ 4d 17a₉ a₁ 8d 29。解得 d 3a₁ 5。前 n 项和公式 S₁₂ (12/2)(2×5 11×3) 6 × (10 33) 6 × 43 258到这里有些开源模型就开始跟不上了。MATH 的准确率通常在 70-90% 之间。第三级AIMEAmerican Invitational Mathematics Examination这是真正的天才级。每年 15 道题考试时间 3 小时每题答案都是 0-999 的整数。AIME 是选拔美国数学奥赛国家队的前置考试。典型题目AIME 2025, Problem 12设 f(x) x³ 3x² 3x 2025。对于实数 t定义 g(t) 为 f(x) t 的最小实数根。求所有使 g(t) 为有理数的 t 的值之和。提示f(x) (x1)³ 2024所以 f(x) 关于 (-1, 2024) 中心对称……这道题大部分人类考生也做不出来。前沿模型中GLM-5.2 在 AIME 2026 上达到 99.2%o3-pro 也接近这个水平。但这是 Chain-of-Thought 多数投票 大量算力堆出来的——不是一次推理能答对的。一条有趣的规律这三个 Benchmarks 的分数随着时间推移呈现出规律性的阶梯上移2023年: GSM8K ~60% → MATH ~30% → AIME 无人问津 2024年: GSM8K ~85% → MATH ~60% → AIME ~10-20% 2025年: GSM8K ~95% → MATH ~85% → AIME ~50-70% 2026年: GSM8K ~99% → MATH ~92% → AIME ~90%不是大模型突然变聪明了——是 Chain-of-Thought、自洽性采样、搜索型推理等技术的进步。算力换准确率在数学推理上最明显。4.3 HumanEval → SWE-bench代码能力的技术债代码评测经历了类似的难度升级过程。HumanEval写一个函数OpenAI 发布的 164 道 Python 编程题。给模型一个函数签名和 docstring让它补全函数体。典型题目defhas_close_elements(numbers:List[float],threshold:float)-bool:检查列表中是否存在任意两个元素的差的绝对值小于 threshold模型写完后用预置的 test cases 验证。很简单前沿模型普遍 90%。SWE-bench修一个真实的 BugSWE-bench 把难度提升了几个数量级。它不是写个函数而是从真实 Python 开源项目Django、SymPy、matplotlib 等中提取 Issue给出完整的仓库代码要求模型定位 Bug、修改代码、让所有测试通过典型场景SWE-bench 真实 IssueIssue: Django #XXXXX 标题: QuerySet.exclude() 与 Q() 对象结合使用时 在特定条件下生成了错误的 SQL 子查询 项目: django/django 涉及文件: django/db/models/query.py, django/db/models/sql/query.py模型需要理解 Django ORM 的查询构造逻辑定位到生成 SQL 子查询的那段代码理解 exclude() Q() 的组合语义修改代码验证修改不破坏其他测试这不是写代码——这是真正的软件工程。模型需要理解一个几十万行的大项目找到问题所在给出修复方案。SWE-bench Verified 和 SWE-bench ProSWE-bench VerifiedOpenAI 从原始 SWE-bench 中人工验证了一个子集约 500 题去掉了有歧义的、太难的和太容易的SWE-bench Pro更新的版本用新的 Issue抗数据污染2026 年 SWE-bench 排名SWE-bench 目前有两个版本Verified约 500 题人工验证子集和Pro更新的、抗污染的版本。不同模型报告的版本不同分开列。模型SWE-bench VerifiedSWE-bench ProClaude Fable 595.0%80.3%Claude Opus 4.888.6%69.2%GPT-5.6 Sol—64.6%DeepSeek V4-Pro80.6%—GLM-5.2—62.1%Qwen 3.6 Plus78.8%—Llama 4 Maverick~65%—注SWE-bench 分数依赖 Agent 框架scaffold选择同一模型在不同评测框架下结果可能不同。Kimi K3 未公布 SWE-bench 分数但它的SWE Marathon类似的多文件修复评测达到42.0%领先 Fable 535%和 GPT-5.6 Sol39%不过评测方式不同不可直接对比。为什么 SWE-bench 对中文开发者特别有冲击力因为修 Bug 是每个程序员每天在做的事。一个模型如果能在 SWE-bench 上拿到 80%意味着它理论上能帮团队里中级工程师处理日常 Bug 修复。4.4 GPQA Diamond博士级推理GPQAGoogle-Proof QA由博士级研究者出的题目标是谷歌搜不到答案。典型题目领域物理化学在 Born-Oppenheimer 近似下一个双原子分子的振-转能级可以用以下公式描述E(v,J) ωₑ(v½) BₑJ(J1) - αₑ(v½)J(J1)其中 v 是振动量子数J 是转动量子数。对于 HCl 分子ωₑ 2989.7 cm⁻¹Bₑ 10.59 cm⁻¹αₑ 0.301 cm⁻¹。从基态到 v1, J0 的跃迁能量最接近A. 2885.7 cm⁻¹B. 2989.7 cm⁻¹C. 3010.6 cm⁻¹D. 2998.2 cm⁻¹这道题即使让物理系的研究生来做也不一定秒答。GPQA Diamond 的准确率前沿模型在 60-91% 之间浮动区分度依然很好。模型GPQA DiamondGPT-5.6 Sol94.1%Gemini 3.1 Pro94.1%Claude Fable 593.2%Kimi K393.5%GLM-5.291.2%o3-pro87.4%Claude Opus 4.8~78%GPQA Diamond 上 GPT-5.6 Sol 和 Gemini 3.1 Pro 并列第一94.1%Kimi K393.5%和 Fable 593.2%紧追在后。这张表的竞争格局比 MMLU 开放得多——新模型在这个维度上还有很大的突破空间。Claude Opus 4.8 在这个指标上意外偏低~78%可能与其推理策略有关而非能力不足。4.5 C-Eval / SuperCLUE中文能力C-Eval 是中文大模型评测的事实标准由上海交大、清华、爱丁堡大学联合发布。它覆盖 52 个中文科目13,948 道 4 选 1 选择题题目直接来自中国教育体系。题目长什么样学科大学物理中文一个质量为 m 的质点沿 x 轴运动势能函数为 V(x) ½kx²。当质点从 x A 处由静止释放时运动到 x A/2 处的速度大小为A. A√(k/m)B. A√(k/(2m))C. A√(k)/(2√m)D. √(3k/(4m)) · A学科中国法律基础根据《中华人民共和国合同法》下列关于要约和要约邀请的说法哪一项是正确的A. 商业广告均属于要约B. 价目表寄送属于要约C. 要约可以随时撤销D. 要约到达受要约人时生效学科中国古代文学落霞与孤鹜齐飞秋水共长天一色出自哪位作者的哪篇作品A. 王勃《滕王阁序》B. 杜甫《登高》C. 李白《将进酒》D. 苏轼《赤壁赋》这些题不仅考语言能力更考中文语境下的知识积累。这也是为什么 Qwen、GLM 等国内模型在 C-Eval 上能超越 GPT/Claude——它们在中文本土知识上训练得更多。2026 年 C-Eval 排名模型C-EvalK2.5-1T-A32BKimi 前代94.0%Qwen3-Max-Thinking93.7%Gemini 3.1 Pro93.4%Qwen3.5-397B-A17B93.0%Claude Opus 4.892.2%GPT-5.6 Sol—Claude Fable 5—注Fable 5 和 GPT-5.6 Sol 均未公布 C-Eval 分数因此不列在表格中。⚠️ 数据污染问题C-Eval 最大的问题是数据污染严重。研究表明 C-Eval 的污染率高达约 45%——也就是说接近一半的测试题在训练数据中出现过。一些模型可能不是掌握了中国法律而是记住了这道选择题的答案。这也是为什么看 C-Eval 分数要打折扣一个 94% 的 C-Eval 和一个 87% 的 MMLU-Pro前者未必代表更强的中文能力。4.6 长上下文Needle-in-a-Haystack / RULER长上下文评测的核心逻辑很简单把一条关键信息藏在极长的文本中问模型关于这条信息的问题。Needle-in-a-Haystack大海捞针测试步骤生成一个超长文本比如 100K tokens内容可以是 Paul Graham 的散文在某个随机位置插入一句话“needle”“中国最深的淡水湖是天池”问模型“中国最深的淡水湖是什么”如果模型能答对说明它在长上下文中成功检索到了这条信息。不同模型在不同上下文长度下的表现可以画成一张热力图上下文长度 → 模 128K: ████████████████████ 98% 型 64K: ████████████████████ 99% 位 32K: ████████████████████ 100% 置 16K: ████████████████████ 100% ↓ 8K: ████████████████████ 100% 4K: ████████████████████ 100% ← 针在文本中的插入位置 →好的模型是全红的不管针插在哪都能找到差的模型在长文本针在中间位置时准确率骤降。RULER升级版的捞针RULER 不满足于简单的找一句话它测试几种不同的检索场景单针和 Needle-in-a-Haystack 一样多针插 4 条信息全找出来多针变量绑定“Alice 的生日是 3 月 15 日Bob 的生日是 7 月 22 日。Alice 的生日是几月”数值推理“3 月 5 月 8 月7 月 4 月 11 月。9 月 6 月 ”后者需要模型在长上下文中既检索又推理比单纯的捞针难得多。2026 年长上下文现状128K 以内所有前沿模型表现优秀95% 召回率128K - 1M大部分模型开始出现中心退化文本中间位置的信息更难找到1M只有少数模型GLM-5.2 的 1M context、Gemini 1.5 Pro声称支持但实际检索精度还有折扣关键发现长上下文支持 ≠ 长上下文好用。上下文越长检索效率越低算力成本越高。多数情况下RAG检索增强生成比硬塞 100 万 token 进去更划算。4.7 Chatbot Arena人类盲评前面的所有 Benchmark 都是自动评测——机器出题、机器打分。但大模型最终是给人用的人觉得好不好这个维度自动评测很难捕捉。这就是 Chatbot Arena 存在的意义。它是怎么工作的Step 1: 用户进入聊天界面 Step 2: 用户输入一个 Prompt Step 3: 两个匿名模型模型 A 和模型 B同时回答 Step 4: 用户看到两个回答并投票哪个更好 Step 5: 用户不知道自己在测哪个模型为什么要盲评自动评测有盲区“写一首关于秋天的诗”——哪首更好这个没法自动打分“给我推荐周末好去处”——推荐的合理性和创意自动评测难以衡量“解释量子计算”——解释得是否通俗易懂计算机无法评判Chatbot Arena 用的是 ELO 评分系统和《英雄联盟》/《棋牌》排位一样的机制新模型初始 1000 分两个模型对决赢家从输家那里拿分如果你赢了排名比你高很多的对手加分多输给排名低的扣分也多长期稳定胜率 → 分数收敛到真实水平为什么 Arena 分数和 Benchmark 分数经常不一致维度自动 BenchmarkChatbot Arena评测内容标准化的考题用户自由提问评分方式自动比对标准答案人类主观判断覆盖范围窄特定能力广综合体验偏差可能过拟合用户偏好偏差时效快跑完即出分慢需要大量投票一个模型可能在 MMLU 上 92%在 Arena 上评分一般——因为它知识广但不会聊天。反之亦然一个聊天体验很好的模型可能在 MMLU 上只有 85%。2026 年 Arena 格局截至 2026 年中Arena 前列模型和自动评测排名大体一致但略有差异Claude 系列在对话体验上常年领先GPT 系列紧随其后DeepSeek 和 Qwen 在特定任务上接近前沿模型Arena 也是中文模型的强项——中文用户投票多中文对话体验好五、一张大表2026 年中旗舰模型能力对比汇总 4.1-4.7 的数据模型参数量MMLUMMLU-ProSWE-benchGPQA DiamondC-Eval参考价格 ($/M tok)Claude Fable 5——91.5%95.0%Ver93.2%—$10/$50GPT-5.6 Sol———64.6% Pro94.1%—$15/$60Gemini 3.1 Ultra—90.4%89.8%——93.4%—Kimi K32.8T MoE~95%¹—42.0%²93.5%—开源DeepSeek V4-Pro~685B MoE87.2%—80.6%Ver——$0.87GLM-5.2744B MoE87.3%86%62.1% Pro91.2%~92%$1.40Qwen3.5-397B-A17B397B MoE—87.8%59.9%³—93.0%—Llama 4 Maverick400B MoE84.7%—~65% Ver——开源¹ Kimi K3 的 MMLU 95% 来自部分来源报告非官方正式公布需谨慎参考。² Kimi K3 的 SWE Marathon 42% 与标准 SWE-bench 评测方式不同不可直接横向对比。³ Qwen3.5-397B-A17B 的分数来自 SWE-rebench非标准 SWE-bench Verified。Ver SWE-bench Verified | Pro SWE-bench Pro更难的版本几个关键观察SWE-bench 是目前最能拉开差距的单一 Benchmark——Fable 595%到 Llama 465%差距 30 个点GPQA Diamond 上 GPT-5.6 Sol、Gemini 3.1 Pro、Kimi K3 三家几乎打平——都在 93-94% 区间DeepSeek V4-Pro 是性价比之王——$0.87/M tok 实现 80.6% SWE-bench比闭源模型便宜 30-60 倍Kimi K3 作为开源模型在 GPQA 上达到 93.5%——仅次于 GPT-5.6 Sol超过 Fable 5Claude Fable 5 在代码能力上断层领先——SWE-bench Pro 80.3%比 GPT-5.6 Sol 的 64.6% 高 16 个点中文能力方面——Gemini 3.1 Ultra93.4%、GLM-5.2~92%、Qwen3.593%在 C-Eval 上领先六、去哪里查最新评测数据看完上面的分析你可能会想这些数据从哪来的如果我几个月后再看这篇文章数据已经过时了怎么办别担心——Benchmark 数据是实时更新的有几个好用的站点你可以直接收藏。6.1 综合排行榜网站站点地址特点LLM Statsllm-stats.com300 模型按综合评分/价格/速度/上下文长度多维度排序每个模型有完整的 Benchmark 雷达图Artificial Analysisartificialanalysis.ai智能指数Intelligence Index汇总 10 项评测散点图智能 vs 价格/速度最直观DataLearnerAIdatalearner.com/leaderboards国内平台支持选 4 个模型横向对比国产模型维度最全含 C-Eval/AGI Eval 等中文评测Chatbot Arenalmarena.aiELO 排位人类盲评唯一反映真实对话体验的排名6.2 分类专项排行榜专项站点说明SWE-benchswebench.com代码修复能力的官方排行榜Verified 和 Pro 两个版本MMLU-Prollm-stats.com/benchmarks/mmlu-proMMLU-Pro 专项129 个模型的排名Open LLM Leaderboardhuggingface.co/spaces/open-llm-leaderboardHugging Face 的开源模型排行榜只列开源权重Aider Leaderboardaider.chat/docs/leaderboards代码编辑专项测的是在已有代码上修改的能力LiveCodeBenchlivecodebench.github.io编程竞赛题实时更新抗污染6.3 GitHub 上的可视化项目如果你想直接看图表而不是翻表格这两个开源项目把数据直接画出来了ai-race追踪 OpenAI、Anthropic、Google、xAI、国内五家实验室的模型在 10 个 Benchmark 上的表现有跨时间折线图可以看到每个模型的能力演进轨迹ai-benchmark-arena纯前端交互面板120 模型、11 个 Benchmark、6 种图表类型柱状图、水平条形图、雷达图、散点图、气泡图、热力图。支持搜索、筛选、导出 CSV直接部署到 GitHub Pages6.4 怎么看这些网站实践建议快速看排名→ LLM Stats 的综合评分排序对比 2-4 个模型→ DataLearnerAI 的对比模式或 Artificial Analysis 的散点图按场景选模型→ 写代码看 SWE-bench数学看 AIME中文看 C-Eval看趋势→ AI Race 的折线图看某个模型在过去几个月的能力变化做决策前→ 不要只看一个网站交叉验证 2-3 个来源七、评测的脏套路看懂分数再信它7.1 数据污染——最大的隐患MMLU 的测试集是否出现在训练数据中答案是经常是。大模型的训练数据来自互联网而很多 Benchmark 的测试集也在互联网上公开。模型训练的时候看过这些题测试的时候就变成了回忆而非推理。C-Eval 污染率估计约 45%MMLU 也被污染虽然程度不同SWE-bench Pro 通过不断更新 Issue 来抗污染——但治标不治本最激进的做法一些评测方如 Anthropic已经不再公开新的测试集而是使用动态生成的方式每次测试生成不同的题目。7.2 评测设置不同结果差 10 个点同一个模型不同的评测设置可以得出截然不同的分数模型 X 的 MMLU 分数 zero-shot, direct answer: 84.2% 5-shot, direct answer: 87.1% 5-shot, CoT: 89.5% 5-shot, CoT 多数投票×10: 91.3%所以当你看到MMLU: 94%时必须问是 5-shot 还是 zero-shot有没有用 CoT有没有多数投票评测设置可能比模型能力本身对分数的影响更大。7.3 MMLU 饱和 → 业界往哪走Benchmark 的发展是一个永无止境的军备竞赛MMLU (已饱和) → MMLU-Pro (正在饱和) → GPQA Diamond / HLE GSM8K (已饱和) → MATH (接近饱和) → AIME / FrontierMath HumanEval (已饱和) → SWE-bench (进行中) → SWE-bench Pro Needle-in-a-Haystack → RULER / L-Eval每当一个 Benchmark 的分数接近 95%它就失去了区分度业界就会开发一个新的、更难的 Benchmark。7.4 分数≠能力统计显著性MMLU 的随机方差是多少大约 ±1.2%。这意味着模型 A 92.1% vs 模型 B 91.8% →无法判定谁更强差距在噪声范围内模型 A 92.1% vs 模型 C 89.5% →能判定 A C只看分数不看置信区间 只看标题只看正文。八、怎么看懂 / 怎么用 Benchmark场景化选型指南你的场景最该关注哪个 Benchmark代码补全 / 代码审查SWE-bench Verified / Pro智能客服 / 知识问答MMLU-Pro / C-Eval数学解题AIME / MATH长文档分析RULER / Needle-in-a-Haystack通用对话Chatbot Arena中文场景优先C-Eval Arena 中文分榜安全 / 合规TruthfulQA 红队报告性价比导向DeepSeek V4-Pro 的 SWE-bench/价格比选模型的三步法Step 1: 确定你的核心场景写代码问答 Step 2: 找到对应场景的核心 Benchmark Step 3: 在 Benchmark 分数接近的模型中优先选更便宜 / 更快 / 更容易部署的最后一条建议在自己业务上跑一遍比看任何排行榜都准。排行榜告诉你的是这个模型在标准化考试中的表现。但你的业务场景很可能不在这些 Benchmark 的覆盖范围内——只有你自己跑过的测试才能真正回答这个模型适合你的任务吗。九、总结Benchmark 是标尺不是判决。它告诉你模型在特定维度的相对位置不告诉你模型好不好。最后一轮复习看懂分数前先看设置——5-shot 还是 zero-shotCoT 还是 direct设置比分数重要要对比就比同一 Benchmark 的同一版——MMLU 和 MMLU-Pro 是两个不同的考试对高分保持警惕——如果一个 Benchmark 的前沿模型平均 90%它已经接近失效中文评测有数据污染问题——C-Eval 高分要打折看代码能力是 2026 年最重要的区分维度——SWE-bench 是目前最能拉开差距的单一 Benchmark性价比也是一种能力——DeepSeek V4-Pro 以闭源 1/30 的价格做到 80% SWE-bench最终相信自己的测试——排行榜是参考你自己的场景才是真理这个专栏专注于 LLM 推理与部署的底层技术——从算子开发、显存管理、调度策略到生成优化用可运行的代码和可复现的实验把论文里的黑科技变成可以理解、可以动手验证的知识。如果你对GPU 到底在干什么和推理框架做了什么优化这类问题感兴趣欢迎来主页翻翻其他文章。
郑州网站建设
网页设计
企业官网