Grok 4.5 发布:xAI 的 Opus 级、低成本编程模型
TECH

Grok 4.5 发布:xAI 的 Opus 级、低成本编程模型

23+
Signals

战略概览

  • 01.
    SpaceXAI 于 2026 年 7 月 8 日发布了 Grok 4.5——这是该公司上市后的首款模型——定价为每百万输入 token 2 美元,每百万输出 token 6 美元,而 Claude Opus 4.7 的价格为 5 美元/25 美元。马斯克称其为‘一个 Opus 级别的模型,但速度更快、token 效率更高、成本更低。’
  • 02.
    据称该模型运行在一个新预训练的‘V9’基础模型上——这一名称和规模由一次独立技术分析估算得出,但 xAI 尚未正式确认——该模型通过 xAI 收购 Cursor 后获取的开发者会话数据联合训练,这笔交易的估值据报接近 600 亿美元。
  • 03.
    各媒体的基准测试结果褒贬不一:Grok 4.5 在 SWE Marathon 基准测试中领先(29.0% 对比 Claude Opus 4.8 的 26.0%),在 Terminal Bench 2.1 上几乎与 GPT 5.5 持平(83.3% 对比 83.4%),但在 DeepSWE 1.1 上落后于 Opus 4.8(53% 对比 59%),而在 SWE Bench Pro 上每项任务仅使用了约四分之一的 token(15,954 对比 67,020)。
  • 04.
    马斯克还表示,Grok 4.5 有助于证伪一个存在了约 30 年的图论猜想,但截至目前,尚无链接的同行评审论文或独立的形式化验证来支持这一结果。

深度分析

真正的突破并非更大,而是 Cursor 的数据

Grok 4.5 并非其前身的轻量微调——一次独立技术分析估计它运行在一个新预训练的‘V9’基础模型上,尽管 xAI 尚未正式确认这一说法。但更具决定性的输入是数据,而非模型规模。在 xAI 据报收购 Cursor(估值接近 600 亿美元)[1]后,真实的开发者会话编码数据被纳入训练,Grok 4.5 现已内置于 Cursor 的所有订阅计划中,而非作为附加集成 [2]。这种优势在原始排行榜排名中体现不多,更多体现在效率上:在 SWE Bench Pro 上,Grok 4.5 每项任务仅使用 15,954 个 token,而 Claude Opus 4.8 使用了 67,020 个 [3],这一差距更可能是由实用的、真实世界的编码轨迹而非单纯的参数数量所解释。这比‘最大模型获胜’的故事更低调,但可能更具持久性:xAI 实质上通过购买获得了训练数据优势,而没有专属 IDE 关系的竞争对手难以复制。

一次可能挤压 Anthropic 和 OpenAI 的降价

最引人注目的数字是定价:每百万输入 token 2 美元,每百万输出 token 6 美元,而 Claude Opus 4.7 为 5 美元/25 美元 [4]。这并非边际折扣——在输出端,每 token 成本仅为对手的四分之一到五分之一,而输出 token 在代理式编程支出中占主导地位。分析师认为这是有意为之的竞争策略,而非效率的副产品:Futurum Group 的 Bradley Shimmin 认为,SpaceXAI 的编程聚焦对市场有利,因为它提升了竞争压力,最终使企业买家受益 [5];Counterpoint 的 Neil Shah 表示,这一定价‘可能通过为高体积编码和代理式 AI 工作负载提供低成本选项,对企业的 AI 定价施加压力’[5]。其他报道明确将其视为一场可能动摇 Anthropic 和 OpenAI 在高体积编码和代理式工作负载上利润率的潜在价格战 [6]。时机进一步加剧了竞争:Grok 4.5 与 OpenAI 新模型发布的时间窗口相近,将本可能是一次常规更新转变为三方在定价与能力上的对峙 [7]

马斯克罕见的克制态度遭遇开发者的分歧评价

马斯克本人的表述引人注目的是其与典型发布炒作的迥异。他并未宣称绝对优势,而是描述 Grok 4.5 为‘尚未达到 Fable 的水平,但它非常快、成本效益高,能完成任务’[8]——这种克制、近乎‘工作马’式的表述承认了在原始能力上的差距,转而押注速度与成本。这种克制与开发者群体的实际反馈一致:一些人报告称,在真实编程会话中,它以一小部分价格实现了接近 Opus 级别的质量,称赞其低 token 消耗和强大的工具调用能力;而另一些人则描述它在复杂或长上下文任务中容易失去焦点、过度设计解决方案,或‘在错误时非常自信’。一些代理式失败的案例(包括一次生产数据库被删除)与第三方开发者对其快速融入现有工作流的由衷热情并存。这种基准测试表述与实际体验之间的差距本身就是一个故事:Grok 4.5 在 SWE Marathon 上对 Opus 4.8 的领先 [9],在你是按 token 计价还是在调试一个崩溃的构建时,解读截然不同。

一项尚无人验证的数学突破

除了编程基准测试,马斯克还宣传了一个更惊人的主张:Grok 4.5 有助于解决一个存在约 30 年的图论猜想,在一个说法中,它围绕泊松半群的超收缩性构建了一个反例 [8];在另一个说法中,它在一次常规 Slack 讨论中大约八分钟内证伪了该假设 [10]。这两个说法在细节上并不完全一致,且截至目前,均未附带链接的同行评审论文或独立的形式化验证 [8]。这种差距的重要性超越了这一个案:它生动展示了,仅仅因为一位知名人物明确陈述,一个未经验证的 AI 主张如何能迅速被当作既定事实传播。此次发布也非孤立事件——它与市场上其他前沿模型的发布几乎同期,增加了快速宣传一个吸引眼球成果的压力,而非等待审查。在独立数学家正式验证其工作之前,该猜想主张最好被视为一个营销数据点,而非已验证的科学成果。

历史背景

xAI 为 X Premium 用户以 Grok-1 模型为基础推出了原始 Grok 的测试版。
Grok 3 向 X Premium Plus 订阅用户和 xAI 平台发布。
Grok 4 作为 xAI 的旗舰模型发布,具备更强的推理能力、原生工具调用功能,以及每月 300 美元的 SuperGrok Heavy 套餐。
据报 SpaceX 收购了 xAI,并在 2026 年 6 月 IPO 前将该 AI 部门重新命名为 SpaceXAI。
SpaceXAI 公开发布了 Grok 4.5,这是其上市后的首款模型发布。

关键关系图

关键玩家
主题

Grok 4.5 发布:xAI 的 Opus 级、低成本编程模型

XA

xAI / SpaceXAI

Grok 4.5 的开发与发布方;将其定位为上市后推出的 Opus 级、低成本编程与代理式模型。

EL

Elon Musk

xAI/SpaceXAI 领导人,宣布了发布,将 Grok 4.5 与 Claude Opus 对比,并宣传了数学猜想主张。

CU

Cursor

据报被 SpaceXAI 以接近 600 亿美元估值收购的 AI 编程初创公司;其开发者会话数据被用于联合训练 Grok 4.5,该模型现已内置于 Cursor 的所有订阅计划中。

AN

Anthropic (Claude Opus)

在整个报道中被用作主要竞争基准;Grok 4.5 在价格和性能上被反复与 Claude Opus 4.7/4.8 进行比较。

OP

OpenAI

竞争实验室,据报在同一时期发布了新模型,使此次发布被视为前沿模型窗口期的直接对决。

事实来源

10 条引用
  1. [1] Grok 4.5 proves xAI's $60 billion Cursor bet was right
  2. [2] What is Grok 4.5? xAI's Cursor Coding Model
  3. [3] Grok 4.5: Elon Musk vs Claude Opus
  4. [4] SpaceXAI releases Grok 4.5, which Elon describes as an Opus-class model
  5. [5] Grok 4.5 Review
  6. [6] SpaceX's Grok 4.5 launches at half the price of rivals
  7. [7] SpaceX launches new Grok model
  8. [8] Grok 4.5 cracks 30-year-old graph theory conjecture, Musk says
  9. [9] Grok 4.5 tops SWE Marathon benchmark
  10. [10] Grok 4.5 helped disprove a mathematical hypothesis unresolved for about 30 years

来源文章

Top 1

THE SIGNAL.

Analysts

表示 SpaceXAI 以编程为先的聚焦对更广泛的市场有益,因为它提升了竞争压力,最终有利于企业。

Bradley Shimmin
分析师,Futurum Group

表示 Grok 4.5 的定价可能通过为高体积编码和代理式 AI 工作负载提供低成本选项,对企业的 AI 定价施加压力。

Neil Shah
分析师,Counterpoint
The Crowd

Grok 4.5, our most capable model yet, is now available across grok.com, X, and the iOS and Android apps.

@@grok3469

Grok 4.5 is not quite as good as Fable, but it is very fast, cost-effective and gets the job done

@@elonmusk15565

Ok Grok 4.5 is insane. People are already building things that shouldn't be possible this fast. 10 wild examples:

@@minchoi1225

Elon hails its Grok 4.5 by sharing the SWE benchmark and still can't figure out why the majority of people prefer Claude Mythos/Fable 5

@u/Current-Guide594447
Broadcast
Grok 4.5 explained in 8min..

Grok 4.5 explained in 8min..

New Grok 4.5 Finally Hits Claude Hard

New Grok 4.5 Finally Hits Claude Hard

I Tested NEW Grok 4.5 for Coding. Wow. Just Wow.

I Tested NEW Grok 4.5 for Coding. Wow. Just Wow.

Grok 4.5 发布:xAI 的 Opus 级、低成本编程模型 — AI 新闻 | Agentic Brew