Grok 4.6 发布:基准测试、价格战与 Cursor 收购
TECH

Grok 4.6 发布:基准测试、价格战与 Cursor 收购

36+
Signals

战略概览

  • 01.
    xAI(品牌为 SpaceXAI)于 2026 年 8 月 12 日发布了 Grok 4.6,这是 Grok 4.5 的一次训后升级,专为长期运行的代理、编码、研究和视觉工作而构建,价格维持在 Grok 4.5 的水平。
  • 02.
    API 定价为每百万输入 token 2 美元,每百万输出 token 6 美元,但缓存输入定价从每百万 token 0.30 美元上涨至 0.50 美元,且超过 200,000 token 的请求将对整个请求按双倍费率计费。
  • 03.
    基准测试结果参差不齐:根据一份报告,Grok 4.6 在 GDPval-AA v2 Elo 上领先(尽管另一来源显示其在相同指标上落后于 Claude Opus 5),在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平,但在 Terminal-Bench v3.0 上得分远低于 GPT-5.6 Sol 和 Claude Fable 5。
  • 04.
    SpaceX 于 2026 年 8 月 14 日完成了对 Cursor 母公司 Anysphere 的 600 亿美元全股票收购,比 Grok 4.6 发布晚两天。

xAI 发布帖中不会提及的基准测试

xAI 自己为 Grok 4.6 发布的材料严重依赖有利的表述:据称该模型在 WANDR 基准测试中处于性能与效率的帕累托前沿,以超过 60% 的更低成本达到与 Claude Fable 5 相同的结果[1],而 Artificial Analysis 赋予其 GDPval-AA v2 Elo 得分为 1753,领先于 Claude Fable 5 的 1741 和 GPT-5.6 Sol 的 1728[2]。但同一家基准测试机构的完整报告使这一领先变得复杂:在 Terminal-Bench v3.0 上,Grok 4.6 仅得 26%,远落后于 GPT-5.6 Sol 的 34.6% 和 Claude Fable 5 的 34.1%[2],而另一项独立评测发现其非幻觉率为 65.7%——这一数据从未出现在 xAI 自己的十行评测表中[3]。该模型也并非如版本号暗示的那样全新:它沿用了与 Grok 4.5 相同的 1.5 万亿参数 V9 基础架构,其提升来自更长的补充训练和优化的 SFT/RL,而非更大的架构[4]。引用马斯克本人言论的 Reddit 用户将 4.6 版描述为本质上是 Grok 4.5 应用了更多强化学习,而非更大的模型。

现实世界测试进一步偏离了发布叙事。独立评测中引用的一位实践者称 Grok 4.6 的编码能力“在实际使用中大约相当于 Opus 4.8,但明显低于 Opus 5”[3]。这并未抹去 Grok 4.6 真实的效率优势——Artificial Analysis 测得其平均以约 53 步和 0.5 亿输入 token 完成长周期代理任务,而 Claude Opus 5 在最大模式下需约 103 步和 20 亿输入 token[2]——但这确实意味着 xAI 发布时使用的“客观第一”表述建立在选择性基准之上,而非全面领先。

比竞争对手便宜,但并非最便宜

xAI 将 Grok 4.6 的 API 定价维持在每百万输入 token 2 美元、每百万输出 token 6 美元,与 Grok 4.5 相同,远低于 xAI 竞争对手在发布时公布的每 token 费率。这一差距是真实的,也是投资者 Gavin Baker 所引用的数字,他认为 Grok 4.6 以约 85% 的折扣提供了大致相当于 Claude Fable 5 Max 的性能[5]。但 xAI 并非当天唯一行动的实验室:DeepSeek 在 Grok 4.6 发布数小时内推出了 V4 Pro,定价为每百万输入 token 0.435 美元、每百万输出 token 0.87 美元——仅输出 token 就比 Grok 4.6 便宜约七倍[6],将 xAI 描述为价格胜利的局面转变为更广泛同日价格战的一环。

社区成本分析将价格故事从标价推进到每任务完成成本:在 DeepSWE 基准测试中,Grok 4.6 在最高努力模式下得分为 67,每任务成本约 5.50 美元,而 GPT-5.6 在最大模式下以约 0.61 美元每任务达到相同分数,DeepSeek V4 Pro 以约 0.06 美元每任务得分为 63——这表明一旦计入耗 token 的推理,尽管 Grok 4.6 的广告费率较低,它未必是达到特定质量门槛的最便宜方式。xAI 的细则为重度用户增添了额外复杂性:一旦请求超过 200,000 token,整个请求(而不仅是超额部分)将按每百万 token 4 美元和 12 美元的双倍费率计费[7],且与 Grok 4.5 相比,缓存输入定价从每百万 token 0.30 美元上涨至 0.50 美元[1]。净效果是,市场中“比 OpenAI 和 Anthropic 便宜”成立,但“绝对最便宜”则不然。

为何是现在:Cursor 交易在同周完成

SpaceX 对 Cursor 母公司 Anysphere 的 600 亿美元全股票收购于 2026 年 8 月 14 日生效,比 Grok 4.6 发布晚两天[8]。这一时间点的根源比交割日期更早:SpaceX 在 2026 年 4 月获得一项期权,可选择支付 100 亿美元与 Cursor 建立合作关系,或以 600 亿美元直接收购该公司,该公司在两个月后行使了该期权[9]。关于原始交易的报道指向一个具体动机——xAI 的编码工具(包括 Grok 本身)在开发者市场份额上已落后于 Anthropic 的 Claude Code 和 OpenAI 的 Codex,因此直接收购领先的独立编码代理产品比从头构建更快[9]。Cursor 为交易带来了真实规模:到 2026 年年中,其年化收入已达到约 26 亿至 40 亿美元[9],使 xAI 在单笔交易中同时获得企业客户群和大量真实世界编码训练数据。

两家公司在交易完成前已开始合作:SpaceXAI 和 Cursor 在收购交割前数月已联合训练一个模型,计划在 Cursor 和 Grok Build 中发布。Reddit 上的社区讨论增加了官方公告未提及的细节——一些用户反复推测,现在并入 xAI 的 Cursor 工程团队是 Grok 4.6 在代理编码方面取得进展的背后原因,理由是 xAI 原始创始团队的大部分成员已离职。无论内部机制如何,实际结果在产品中清晰可见:Grok 4.6 在发布首周内于 Cursor 和 Grok Build 中提供双倍包含使用量[11],这一促销仅在模型与编码工具被视为同一公司两部分而非供应商关系时才具有商业意义。

节奏策略:为何 Grok 4.7 已在路上

Grok 4.6 并未被定位为最终版本。马斯克在发布前数周已预告发布节奏——Grok 4.6 按计划发布,Grok 4.7 预计约一个月后跟进[10]——一位亲身体验评测者报告称,马斯克在 4.6 发布后不久即描述了一个内部已更好的构建版本。从一个角度看,这种节奏看似是有意的战略选择:将竞争轴心从“谁在发布日拥有单一最佳模型”转向“谁控制最快的迭代循环”。在此视角下,Grok 4.6 更像是一个检查点,而非完成的旗舰产品——该模型部分是为了锁定价格和在 xAI API、Grok Build、Cursor、OpenRouter、Vercel 和 Cloudflare,以及新近的 Perplexity 和 Perplexity Computer 上的分发[11],而其创造者自己预计其能力领先优势将在数周内丧失。

这种框架也解释了一个否则看似奇怪的选择:xAI 在 Grok 4.5 和 4.6 之间完全保持定价不变,而非为“新”模型收取溢价[1]。稳定定价与快速能力迭代正是节奏策略的核心——它消除了成本作为开发者在每个新检查点犹豫的理由,同时能力提升持续快速到来,使竞争对手始终在应对上一版本而非当前版本。社区猜测下一次跃升将涉及一个明显更大的模型——传闻中的 2.1 万亿参数 Grok 4.7,部分基于 SpaceX 自身运营数据训练——若属实,这将标志着真正偏离 4.5 到 4.6 时期“对相同基础架构更强化训练而非更大”的模式。无论如何,现在每个竞争对手实验室都必须决定是匹配 xAI 的发布节奏,还是继续仅以模型质量竞争,而 Grok 4.6 的平价定价和同周 Cursor 整合显然旨在迫使这一决策。

历史背景

SpaceX 获得一项期权,可选择支付 100 亿美元与 Cursor 建立合作关系,或在当年晚些时候以 600 亿美元直接收购该公司。
SpaceX 宣布以 600 亿美元全股票交易收购 Cursor。
Grok 4.5 在 Grok 4.6 发布前约五周公开推出。
xAI 发布 Grok 4.6 当天,DeepSeek 发布 V4 Pro,触发前沿模型价格战。
SpaceX 对 Cursor 母公司 Anysphere 的 600 亿美元收购正式生效。

关键关系图

关键玩家
主题

Grok 4.6 发布:基准测试、价格战与 Cursor 收购

XA

xAI / SpaceXAI (Elon Musk)

Grok 4.6 的开发与发布方;控制定价与发布节奏,公开将该模型定位为在智能、速度和成本上领先,同时推动 Cursor 收购以弥补编码工具差距。

CU

Cursor / Anysphere

被 SpaceX 以 600 亿美元收购的 AI 编码初创公司;在交易前已与 SpaceXAI 联合训练模型,现将其企业客户群和编码数据直接带入 xAI 技术栈。

DE

DeepSeek (Liang Wenfeng)

在 Grok 4.6 发布当天推出 DeepSeek V4 Pro,输出定价约为其七分之一,迫使比较进入更广泛的前沿价格战。

OP

OpenAI / Anthropic

其更高价的 GPT-5.6 Sol 和 Claude Opus 5 / Claude Fable 5 模型在价格上被 Grok 4.6 直接压制,引发利润率压力担忧。

PE

Perplexity AI

在发布后不久将 Grok 4.6 加入 Perplexity 和 Perplexity Computer,扩大了该模型在 xAI 自身产品之外的分发。

事实来源

11 条引用
  1. [1] Introducing Grok 4.6
  2. [2] Grok 4.6: Benchmarks and Analysis
  3. [3] Grok 4.6 Review
  4. [4] SpaceXAI Grok 4.6 Launch, Evals, and Cursor Acquisition
  5. [5] SpaceX Just Unveiled Grok 4.6, Musk Calls It 'Objectively #1' in AI - Anthropic, OpenAI, and This Stock May Be in Trouble
  6. [6] DeepSeek V4 Pro and Grok 4.6 Launch on the Same Day, Igniting a Price War
  7. [7] Grok 4.6 Launch Guide 2026
  8. [8] SpaceX Completes Its $60 Billion Cursor Acquisition
  9. [9] SpaceX Will Buy AI Coding Firm Cursor For $60 Billion
  10. [10] Musk Signals Rapid Grok Rollout: 4.6 in Two Weeks, 4.7 a Month Later
  11. [11] Grok 4.6 in Cursor

来源文章

Top 5

THE SIGNAL.

Analysts

声称 Grok 4.6 在考虑智能、速度和成本时是“客观第一”,将其定位为在权衡价格与能力后处于前沿的顶级模型。

Elon Musk
CEO,SpaceX / xAI (SpaceXAI)

认为 Grok 4.6 以约 85% 的价格折扣匹配了 Claude Fable 5 Max 级别的性能,将其描述为当前前沿最佳性价比方案。

Gavin Baker
投资者

批评 xAI 的发布材料完全未在评测表中包含幻觉率数据,报告了 xAI 自身从未发布的仅 65.7% 的非幻觉率。

eesel AI (independent review)
独立评测者

评估 Grok 4.6 的现实世界编码性能大致相当于较旧的 Claude Opus 版本,明显低于 Claude Opus 5。

Community practitioner (cited in eesel review)
亲身体验测试者
The Crowd

Introducing Grok 4.6. It delivers frontier intelligence and is a significant improvement over Grok 4.5 at the same price.

@@SpaceXAI30355

Cursor is now part of @SpaceX. Today, we have officially closed our acquisition. We will join the @SpaceXAI team to help make Grok the world's most useful AI and improve Grok Build, Grok Bot, Grok API, Cursor, and more. SpaceX has built some of the most inspiring and...

@@cursor_ai34854

We've released the model card for Grok 4.6! It goes in-depth on the capabilities of the model across many different evals for coding, engineering, knowledge work, and more. We also discuss pre-deployment safety testing and our safeguard stack.

@@leerob1491

Grok 4.6 is an equivalent to Sol 5.6 according to artificial analysis arena

@u/Snoo26837824
Broadcast
Grok 4.6 IS REALLY GOOD Beating GPT-5.6 Sol, Opus 5, & Kimi k3?! (Fully Tested)

Grok 4.6 IS REALLY GOOD Beating GPT-5.6 Sol, Opus 5, & Kimi k3?! (Fully Tested)

Grok 4.6 Just Shocked OpenAI and Claude

Grok 4.6 Just Shocked OpenAI and Claude

Grok 4.6 Just Changed the AI Race… It Tied GPT-5.6

Grok 4.6 Just Changed the AI Race… It Tied GPT-5.6