GPT-5.6 Sol 和 Grok 4.5 的能力
TECH

GPT-5.6 Sol 和 Grok 4.5 的能力

21+
Signals

战略概览

  • 01.
    OpenAI 的 GPT-5.6 Sol 是一个新型三档模型家族(Sol、Terra、Luna)的旗舰产品,于 2026 年 6 月 26 日进入有限预览阶段,并于 2026 年 7 月 9 日全面上线,专为代理式编码、空间推理和长周期任务优化。
  • 02.
    一个基于 GPT-5.6 Sol 构建的社区工具可以拍摄任何物体的照片,并将其重建为纯代码形式的 Three.js 3D 模型;Sol 还在一次运行中独立生成了曼哈顿的体素式 3D 渲染图,这些被引用为相比 GPT-5.5 空间推理能力提升的证据。
  • 03.
    xAI/SpaceXAI 的 Grok 4.5 于 2026 年 7 8 日发布,是一款混合专家模型,与 Cursor 共同使用真实开发者交互数据进行训练,旨在在长时间的多文件编码会话中保持连贯性,并以低于 Sol 的激进定价推出。

空间推理才是 Sol 的真正亮点,而非更漂亮的代码

GPT-5.6 Sol 最引人注目的演示是三维的。一个基于 Sol 构建的社区工具将拍摄的物体重建为纯代码形式的 Three.js 3D 模型,而 Sol 在单次运行中生成了曼哈顿的体素渲染图——这被直接引用为相比 GPT-5.5 空间推理能力提升的证据 [2]。在社区方面,用户测试 Sol 在 Blender 中创建 3D 模型的能力,并将其与 Meshy 等专用工具进行对比,结果表现优异。这种能力飞跃不同于单纯的代码质量:模型似乎能长时间保持连贯的空间心智模型,从而一次性输出几何代码,这正是 OpenAI 将 Sol 宣传为其最适合代理式和长周期工作的编码模型的原因 [1]

价格战:Grok 压价,OpenAI 以效率回应

竞争焦点已从单纯的能力转向每单位产出的成本。Grok 4.5 的定价为每百万输入 token 2 美元、每百万输出 token 6 美元,约为 Sol 定价(5 美元/30 美元)的三分之一,并据报道在接近前沿速度下将编码代理成本降低约 80%,尽管其幻觉率较高已被标记 [7]。OpenAI 的应对策略是 token 经济性:它声称 Sol 在 AI 编码任务中 token 效率高出 54%,并在某编码基准测试中以不到先前领先者一半的输出 token 数量创下新纪录 [1]。与此同时,据报道 Grok 在 SWE Bench Pro 上使用的输出 token 数量比此前最强的前沿模型少约 4.2 倍 [3],这意味着一旦按模型实际消耗的 token 定价,实际价格差距会显著缩小。

Cursor 既是 Grok 4.5 的护城河,也是其隐患

Grok 4.5 的差异化在于 xAI/SpaceXAI 与 Cursor 合作,使用数万亿 token 的真实开发者交互数据对其进行联合训练,使其能够在多文件代码库中“像开发者一样思考”,并在长时间会话中保持连贯性 [4][5]。这种真实世界轨迹数据构成了竞争对手难以复制的真实训练护城河。但这种紧密关系也是一把双刃剑:社区讨论指出,Grok 4.5 的训练中曾混入早期 Cursor 代码库的快照,导致其在 CursorBench 上的得分虚高,相关污染数据此后已被移除。教训是:基于训练数据构建的基准测试应大幅打折看待,Grok 最令人印象深刻的编码数据需以此为前提解读。

数据对比

在综合基准测试中,两款模型的表现比营销宣传更接近。Sol 在总体综合得分上以 86 比 82 领先,代理式任务平均得分为 92.0 比 83.3,包括 Terminal-Bench 2.0 的 91.9% 对比 83.3% [6]。但在纯编码平均得分上,Grok 4.5 以 64.7 比 64.6 略微领先 [6]。Sol 拥有约 100 万 token 的更大上下文窗口,而 Grok 为 50 万;而在价格方面,Grok 以 2 美元/6 美元对 Sol 的 5 美元/30 美元取得压倒性优势 [6]。结论是:Sol 主导代理式和长上下文任务,Grok 在成本敏感型编码上以相当的准确率胜出,选择哪款模型完全取决于你的工作负载更依赖哪个维度。

历史背景

GPT-5.6 Sol 进入有限预览阶段,最初仅通过 API 和 Codex 向选定的可信合作伙伴提供。
Grok 4.5 作为 xAI 与 Cursor 正式合作的首款模型发布,使用真实的 Cursor 交互轨迹进行联合训练。
GPT-5.6 Sol、Terra 和 Luna 实现全面可用,结束了政府要求的分阶段发布限制。

关键关系图

关键玩家
主题

GPT-5.6 Sol 和 Grok 4.5 的能力

OP

OpenAI

GPT-5.6 Sol/Terra/Luna 的构建者;Sol 于 6 月 26 日进入有限预览,7 月 9 日全面上线,控制专有 API 和 Codex 的访问权限。

XA

xAI / SpaceXAI

Grok 4.5 的构建者,于 7 月 8 日以每百万输入 token 2 美元的价格发布,以低于 OpenAI 的定价赢得编码代理工作负载。

CU

Cursor

AI 编码编辑器,使用数万亿 token 的真实用户交互数据联合训练 Grok 4.5,并在所有订阅计划中限时免费分发。

DE

Developers and early adopters

报告 Sol 在空间推理和 3D 输出方面有所提升,同时受益于 Grok 4.5 在编码代理任务上的更低成本。

事实来源

7 条引用
  1. [1] OpenAI launches its new family of models with GPT-5.6
  2. [2] OpenAI's GPT-5.6 Sol builds a 3D Manhattan in one shot
  3. [3] SpaceXAI Releases Grok 4.5
  4. [4] Grok 4.5
  5. [5] What is Grok 4.5: xAI's Cursor-trained coding model
  6. [6] GPT-5.6 Sol vs Grok 4.5
  7. [7] Grok 4.5 Cuts Coding Agent Cost 80% at Near-Frontier Speed but Higher Hallucinations

来源文章

Top 1

THE SIGNAL.

Analysts

Grok 4.5 "能够处理需要创造性使用工具来解决问题的复杂、长时间运行的任务",由 SpaceXAI 与 Cursor 联合使用数万亿 token 的 Cursor 数据进行训练。

Cursor team
Grok 4.5 的联合训练方与分发方

Grok 4.5 是"一种基于开发者实际工作方式而非仅代码表面形式的编码模型",旨在在长时间会话中保持连贯性,使行为在任务演进过程中保持一致。

MindStudio analysis
独立分析师评估
The Crowd

1/ Someone built a tool with GPT-5.6 Sol that takes a photo of any object and rebuilds it as a pure code-based Three.js 3D model.

@@VaibhavSisinty5

Grok 4.5: $2 in / $6 out GPT 5.6: $5 in / $30 out Opus 4.8: $5 in / $25 out Grok 4.5 seriously is freaking good price-performance wise. Opus 4.8 level, Sonnet 5 pricing

@@kimmonismus976

Did more testing. I'm honestly impressed by Grok 4.5. Definitely was not on my list of models to be excited about this week. Well, I guess only GPT 5.6 Sol was on that list... And Fable, of course. Anyways, Grok 4.5 is really, really good! At implementing (it's fast) but also

@@maxedapps347

GPT-5.6 Sol is the real deal.

@u/NSDetector_Guy621
Broadcast
A Model Explosion: GPT 5.6 Sol, Grok 4.5 and Meta Muse Rewrite the Rules

A Model Explosion: GPT 5.6 Sol, Grok 4.5 and Meta Muse Rewrite the Rules

GPT-5.6 IS OUT! GLM 5.5 Is Mythos Level, U.S Governement Banning AI Cause of Dario?, & Grok 4.5!

GPT-5.6 IS OUT! GLM 5.5 Is Mythos Level, U.S Governement Banning AI Cause of Dario?, & Grok 4.5!

GPT 5.6 VS Claude Fable 5 VS Grok 4.5 (Honest Results)

GPT 5.6 VS Claude Fable 5 VS Grok 4.5 (Honest Results)

GPT-5.6 Sol 和 Grok 4.5 的能力 — AI 新闻 | Agentic Brew