
模型相关导航包含模型、编码代理、语音、图像、视频、推理、排行榜、关于等内容还有 AI 趋势、竞技场等链接。SpaceXAI Grok 4.6 成绩亮眼2026 年 8 月 12 日消息SpaceXAI 的 Grok 4.6 在人工分析智能指数中获 61 分与 GPT - 5.6 Sol 一同跻身前沿以更低成本展现出色代理性能。Grok 4.6 发布仅一个多月在智能指数上较 Grok 4.5 提高了 5 分与 Grok 4.3 相比则提高了 23 分这使得 SpaceXAI 与 OpenAI 一同重回智能前沿仅次于 Anthropic。关键要点Grok 4.6 跻身人工分析智能指数前沿它获得 61 分与 GPT - 5.6 Sol最高分相当仅次于 Claude Opus 5最高分 63 分和 Claude Fable 5带后备方案的最高分 62 分仅领先于 Kimi K3。强大的代理性能Grok 4.6 在 GDPval - AA v2 Elo 评分中达到 1753 分仅次于 Claude Opus 5且与 Claude Fable 5 和 Qwen3.8 Max 的置信区间有重叠。在 ³ - 银行测试中得分 50.7%与 Qwen3.8 Max51.3%并列前二在 Terminal - Bench v2.1 测试中得分 88.4%与领先模型相当。以更低成本达到前沿智能水平与 Grok 4.5 一样其标价仍为每 100 万个输入/输出令牌 2 美元/6 美元比 Claude Opus 55 美元/25 美元和 GPT - 5.6 Sol5 美元/30 美元低 60%以上。每项任务成本为 0.84 美元与 Kimi K3 相同但智能水平略高使其处于智能与每项任务成本的帕累托前沿。Grok 4.6 在 AA - Briefcase 测试中处于 Fable 5 级别AA - Briefcase 是对长期代理知识工作任务的内部基准测试Grok 4.6 的 Elo 评分为 1577 分落后于 Claude Opus 5 系列。值得注意的是它效率很高平均约 53 轮对话和约 0.5B 输入令牌即可完成任务而 Claude Opus 5最高分则需要约 103 轮对话和约 2.0B 输入令牌。其他模型细节上下文窗口为 500k 令牌与 Grok 4.5 相同输入/输出令牌定价为每 100 万个 2 美元/6 美元缓存命中折扣后为每 100 万个 0.5 美元高于 Grok 4.5 的每 100 万个缓存命中 0.3 美元。代理性能Grok 4.6 在代理工作方面的表现优于静态推理。在 GDPval - AA v2衡量现实世界代理知识工作的主要指标中它的 Elo 评分为 1753 分仅次于 Claude Opus 5并且由于置信区间重叠在统计上与 Claude Fable 5 和 Qwen3.8 Max 无显著差异。这种模式在各类任务中都有体现。³ - 银行测试50.7%考察了使用工具的多轮客户服务能力使 Grok 4.6 跻身前二Terminal - Bench v2.1 测试88.4%使其在基于终端的软件任务上与领先模型持平。很少有模型能同时在知识工作、客户服务和终端使用方面具有竞争力再结合其定价这使 Grok 4.6 在智能指数的每项代理评估中都处于成本与性能的帕累托前沿。成本在前沿领域一代产品保持标价不变是很不寻常的因为通常智能提升会伴随着价格上涨。Grok 4.6 在标价维持 2 美元/6 美元不变的情况下智能指数提高了 5 分测算的每项任务成本为 0.84 美元这既反映了其定价也体现了合理的令牌效率。对买家来说重要的是与比它得分高不超过 2 分的模型进行比较Claude Opus 5 为 5 美元/25 美元GPT - 5.6 Sol 为 5 美元/30 美元。Grok 4.6 与 GPT - 5.6 Sol 的智能指数得分基本相同但输出令牌价格却低得多而在推理密集型工作负载中输出令牌价格是决定成本的主要因素。长期知识工作Grok 4.6 在内部长期代理知识工作任务基准测试 AA - Briefcase 中首次亮相Elo 评分为 1577 分。这使其处于 Fable 5 级别落后于 Claude Opus 5 系列并且在评分标准、展示质量和分析质量方面表现始终强劲而非在某一方面的优势弥补另一方面的劣势。其效率表现与得分同样值得关注。Grok 4.6 平均约 53 轮对话和约 0.5B 输入令牌即可完成任务而 Claude Opus 5最高分则需要约 103 轮对话和约 2.0B 输入令牌。长期代理工作会迅速积累上下文因此一个能用一半的对话轮数和四分之一的输入令牌得出相近答案的模型其成本优势远不止体现在每令牌的定价上。完整结果人工分析智能指数各项评估的详细分解可查看相关图片。如需了解 Grok 4.6 的更多详细信息和基准测试可访问相关页面。阅读最新文章Upstage Solar Pro 4基准测试与分析Upstage 发布了 Solar Pro 4时间为 2026 年 8 月 12 日。NVIDIA 推出 Nemotron 3.5 Lightning高效的设备端规模智能时间为 2026 年 8 月 11 日。宣布推出 AA - AnalystAgent针对现实世界电子表格和文档的定量分析代理基准测试。AA - AnalystAgent 对代理进行测试涉及 14 个商业和科学领域的 80 个内部定量分析问题每个问题都从真实的源电子表格和文档文件夹中获取答案。每个问题运行 5 次主要指标是 pass^5即 5 次尝试均解答正确因为一个只有偶尔正确的分析代理仍需人工检查时间为 2026 年 8 月 10 日。人工分析相关导航可获取新文章通知探索大语言模型排行榜、图像竞技场、视频竞技场、AI 代理、评估等内容还可了解公司的方法论、服务、联系我们、文章、常见问题等信息以及通过多个社交平台关注。