xAI 发布帖中不会提及的基准测试
xAI 自己为 Grok 4.6 发布的材料严重依赖有利的表述:据称该模型在 WANDR 基准测试中处于性能与效率的帕累托前沿,以超过 60% 的更低成本达到与 Claude Fable 5 相同的结果[1],而 Artificial Analysis 赋予其 GDPval-AA v2 Elo 得分为 1753,领先于 Claude Fable 5 的 1741 和 GPT-5.6 Sol 的 1728[2]。但同一家基准测试机构的完整报告使这一领先变得复杂:在 Terminal-Bench v3.0 上,Grok 4.6 仅得 26%,远落后于 GPT-5.6 Sol 的 34.6% 和 Claude Fable 5 的 34.1%[2],而另一项独立评测发现其非幻觉率为 65.7%——这一数据从未出现在 xAI 自己的十行评测表中[3]。该模型也并非如版本号暗示的那样全新:它沿用了与 Grok 4.5 相同的 1.5 万亿参数 V9 基础架构,其提升来自更长的补充训练和优化的 SFT/RL,而非更大的架构[4]。引用马斯克本人言论的 Reddit 用户将 4.6 版描述为本质上是 Grok 4.5 应用了更多强化学习,而非更大的模型。
现实世界测试进一步偏离了发布叙事。独立评测中引用的一位实践者称 Grok 4.6 的编码能力“在实际使用中大约相当于 Opus 4.8,但明显低于 Opus 5”[3]。这并未抹去 Grok 4.6 真实的效率优势——Artificial Analysis 测得其平均以约 53 步和 0.5 亿输入 token 完成长周期代理任务,而 Claude Opus 5 在最大模式下需约 103 步和 20 亿输入 token[2]——但这确实意味着 xAI 发布时使用的“客观第一”表述建立在选择性基准之上,而非全面领先。


