Grok 势头增强:基准测试与投资者热议
TECH

Grok 势头增强:基准测试与投资者热议

23+
Signals

战略概览

  • 01.
    xAI 的 SpaceXAI 于 2026 年 8 月 12 日推出 Grok 4.6,在人工分析智能指数(Artificial Analysis Intelligence Index)上获得 61 分,与 GPT-5.6 Sol Max 持平,仅比 Claude Fable 5 Max 低 1 分。
  • 02.
    投资者加文·贝克(Gavin Baker)称 Grok 4.6 相较于 Claude Fable 5 Max 具有“帕累托优势”,表示其性能大致相当,但成本低 85%,尽管目前极少有 SpaceX 投资者讨论该模型。
  • 03.
    Grok 4.6 的定价为每百万输入令牌 2 美元,每百万输出令牌 6 美元,比 Claude Opus 5 和 GPT-5.6 Sol 便宜超过 60%。
  • 04.
    盈透证券(Interactive Brokers)于 2026 年 6 月 25 日将 Grok 接入其 AI 交易平台,允许客户连接经纪账户,通过自然语言分析投资组合并生成交易指令。

深度分析

帕累托优势的主张:为何华尔街投资者对 Grok 视而不见

Atreides Management 的合伙人加文·贝克(Gavin Baker)在持有 SpaceX 股份的情况下,向该公司投资者群体透露了一则本应引发关注的信息:他们极少提及 Grok,尽管他认为该模型“在许多指标上具有帕累托优势”[1]。这是一次不同寻常的表态——贝克并非 Grok 的鼓吹者,而是一位外部投资者,指出同行可能低估了他们已投资公司内部的一项资产。

贝克的具体观点是,Grok 4.6 在性能上仅比 Claude Fable 5 Max 低 1 分——而后者被他称为“大多数人公认的黄金标准”——但运行成本仅为后者的几分之一:性能大致相当,成本却低 85%,输入令牌便宜 80%,输出令牌便宜 88%。如果这一计算成立,Grok 不仅是前沿领先模型的可行替代品,甚至可以说是每美元投入更具优势的选择,然而机构关注尚未跟上。这一基准现实与投资者关注度之间的差距,比以往任何一次 Grok 更新都更重要,因为 SpaceX 在 2026 年 2 月以全股票交易方式收购 xAI,将合并实体估值定为 2500 亿美元[2],而这一估值的相当一部分,现在取决于投资者如何看待 Grok 在 SpaceX 上市前的发展轨迹。

真正的重点是价格标签,而非分数

抛开投资者的言论,其背后是一个鲜明的价格对比。人工分析(Artificial Analysis)将 Grok 4.6 在智能指数上的得分为 61 分——比一个月前的 Grok 4.5 提升 5 分,比 Grok 4.3 高出 23 分,使其与 GPT-5.6 Sol Max 处于同一梯队,仅比 Claude Fable 5 Max 的 62 分低 1 分[3]。但定价与前一版本完全一致:每百万输入令牌 2 美元,每百万输出令牌 6 美元,该机构计算得出,这比 Claude Opus 5 的 5/25 美元和 GPT-5.6 Sol 的 5/30 美元便宜超过 60%[3]。在每项完成任务的基础上,差距进一步扩大——一项分析显示,Grok 4.5 的编码代理成本为每任务 2.49 美元,而 Claude Code 为 11.80 美元,Codex 为 5.07 美元[4]

这一算术正在重塑开发者实际构建方式。在以编码为核心的社区中,新兴模式并非“完全转向 Grok”,而是“链式调用”:让 Fable 5 或 Opus 等更昂贵的模型负责架构与规划,再将明确定义的实现任务交给 Grok,部分开发者表示这种拆分带来了显著的成本节约。这比“Grok 击败 Fable 5”更平淡,却是真正有真金白银支撑的故事,也正是贝克在股票层面所提出的效率论点。

基准测试彼此矛盾,互联网亦然

取决于你参考哪张表格,Grok 4.6 要么几乎与最佳模型并列,要么明显落后。在特定任务的编码评估中——CursorBench、DeepSWE、FrontierCode、APEX-Agents、Terminal-Bench 和 APEX-SWE——Fable 5 明确领先,而 Grok 在 GDPVal-AA、AA-Briefcase 和 Harvey LAB 上位居榜首[5]。另一项由独立运行的 RubyLLM/OpenCode 测试框架则呈现了第三种图景:GLM 5.3 得分 94,Gemini 3.7 Flash 为 93,Qwen 3.8 Max 跃升 41 分至 92,Grok 以 91 分处于同一梯队[6]。这些排名之间并不完全矛盾,因为它们测试内容不同,但综合来看,解释了为何“帕累托优势”仍是一个有争议的说法,而非定论。

这种争议性直接体现在开发者社区中,对 Grok 4.6 基准测试发布的反应几乎平分秋色:一部分人对其实现的性价比表示真诚兴奋,另一部分则公开质疑数据本身——指责特定评估被“刷分”,或版本变更使跨模型比较不可靠。怀疑背后也存在真实质量担忧:一项对比指出,Grok 4.5 的幻觉率上升至 54%,高于前一版本的 25%[7],这种权衡是智能指数分数无法体现的。

金融集成快于华尔街实际采用

xAI 的金融布局真实且有明确时间线:该公司自 2026 年 3 月起开始专门招聘华尔街银行家和信贷专家,以训练 Grok 在金融建模方面的能力[8],而盈透证券(Interactive Brokers)在同年 6 月将 Grok 接入其 AI 交易平台,允许客户连接经纪账户,免费获取投资组合分析和自然语言交易指令[9]。阿波罗全球管理公司(Apollo Global Management)、摩根士丹利(Morgan Stanley)和瓦洛尔股权合伙公司(Valor Equity Partners)均被报道正在内部测试或使用 Grok[2],零售端的集成名单也在持续增长。

但记录这些集成的报道本身也削弱了“采用”的叙事:据多方消息,已注册试用 Grok 的金融从业者,目前极少将其用于日常实际工作[2]。这种“已集成”与“已采用”之间的差距至关重要,因为它预示了 Grok 未来在任何新领域可能面临的张力——其中一部分阻力根本不是技术性的。在讨论基准测试发布的开发者社区中,反复出现与能力无关的反对声音:一个持续且声音响亮的用户群体表示,无论模型得分如何,他们都不会为任何与埃隆·马斯克(Elon Musk)关联的产品付费,这种购买否决权是任何帕累托优势都无法通过基准测试消除的。

历史背景

xAI 开始招聘华尔街银行家、信贷专家和交易员,专门训练 Grok 在金融建模和策略方面的能力。
盈透证券(Interactive Brokers)推出 Grok 集成,允许客户连接经纪账户,实现 AI 辅助交易。
Grok 4.6 发布,在人工分析智能指数上获得 61 分,与 GPT-5.6 Sol 持平。

关键关系图

关键玩家
主题

Grok 势头增强:基准测试与投资者热议

GA

Gavin Baker

Atreides Management 投资人,持有 SpaceX 股份;他公开将 Grok 与 Fable 5 对比为“帕累托优势”,可能影响机构投资者在 SpaceX 上市前对 xAI 贡献的估值。

XA

xAI / SpaceXAI

Grok 的开发者;于 2026 年 8 月 12 日发布 Grok 4.6,正以成本高效的前沿性能和金融行业集成为卖点,为 SpaceX 计划中的 IPO 铺路。

AR

Artificial Analysis

独立 AI 基准测试机构;其智能指数得分(61 分)是几乎所有 Grok 4.6、GPT-5.6 Sol 和 Claude Fable 5 对比的参考基准。

IN

Interactive Brokers

经纪平台;于 2026 年 6 月将 Grok 与 ChatGPT 和 Claude 一同接入其 AI 交易集成,使该模型能直接访问真实客户经纪账户,用于投资组合分析和订单生成。

AP

Apollo Global Management, Morgan Stanley, Valor Equity Partners

被报道正在内部测试或使用 Grok 的华尔街机构,是 xAI 在 SpaceX IPO 前向金融领域拓展的一部分。

事实来源

9 条引用
  1. [1] Gavin Baker Says Very Few Investors Talk About Grok
  2. [2] Musk's xAI in a Wall Street Push With the Grok Chatbot
  3. [3] Grok 4.6: Benchmarks and Analysis
  4. [4] SpaceXAI Grok 4.6 Matches GPT-5.6 Sol on AI Index
  5. [5] Grok 4.6 vs GPT-5.6 Sol vs Claude Fable 5
  6. [6] LLM Benchmarks: Qwen 3.8, GLM 5.3, Gemini 3.7
  7. [7] Grok 4.5 Is So Cheap Compared to Fable 5 and GPT-5.5 That Benchmark Gaps May Not Matter Much
  8. [8] Musk's xAI Hiring Credit Experts, Bankers to Teach Grok Finance
  9. [9] Interactive Brokers Adds ChatGPT, Grok to AI Trading Platform

来源文章

Top 1

THE SIGNAL.

Analysts

“Grok 4.6 的性能大致与 Fable 5 Max 相当,但成本低 85%。输入令牌便宜 80%,输出令牌便宜 88%。具有帕累托优势。” 贝克认为,市场尚未将 Grok 相对于被普遍视为黄金标准的模型所具备的成本效率纳入定价。

Gavin Baker
Atreides Management 投资人

“Grok 4.6 使 SpaceXAI 重返智能前沿,并在成本效率上领先”——评估该模型达到前沿级智能水平,同时在成本和代理任务效率上领先同类模型。

Artificial Analysis
独立 AI 基准测试机构
The Crowd

Gavin Baker on Grok 4.6 Outpacing Anthropic “This is pretty wild … You're well ahead of Fable 5, which I think most people would agree is the gold standard … Very few investors talk about Grok at all and it is Pareto dominant on a lot of measures … Maybe people should [show more]”

@@TheChiefNerd852

I tested Gemini 2.7 Flash vs Qwen 3.8 vs Grok 4.6 vs GLM. Same prompt, 2 scenes: a harvester and farmers working. honestly? Qwen 3.8 impressed me. it just did what I asked. Grok 4.6 failed on coloring. Qwen > GLM > Grok > Gemini. which one did better for you?

@@Bhavani_00007323

Grok just added two powerful new finance integrations - Robinhood and eToro. And the integration wave keeps expanding: Finance → productivity → analytics → development → advertising → payments. Grok is steadily becoming the AI layer that connects across everything you already use.

@@XFreeze323

Grok 4.6 Benchmarks

@u/u_are_mad518
Broadcast
Grok 4.6 IS REALLY GOOD Beating GPT-5.6 Sol, Opus 5, & Kimi k3?! (Fully Tested)

Grok 4.6 IS REALLY GOOD Beating GPT-5.6 Sol, Opus 5, & Kimi k3?! (Fully Tested)

Grok 4 Fully Tested (INSANE)

Grok 4 Fully Tested (INSANE)

Grok 4.5 IS REALLY GOOD! Opus & GPT Level BUT Faster, Cheaper, & Smarter! (Fully Tested)

Grok 4.5 IS REALLY GOOD! Opus & GPT Level BUT Faster, Cheaper, & Smarter! (Fully Tested)

Grok 势头增强:基准测试与投资者热议 — AI 新闻 | Agentic Brew