
GPT-5.6 Sol 和 Grok 4.5 的能力
战略概览
- 01.OpenAI 的 GPT-5.6 Sol 是一个新型三档模型家族(Sol、Terra、Luna)的旗舰产品,于 2026 年 6 月 26 日进入有限预览阶段,并于 2026 年 7 月 9 日全面上线,专为代理式编码、空间推理和长周期任务优化。
- 02.一个基于 GPT-5.6 Sol 构建的社区工具可以拍摄任何物体的照片,并将其重建为纯代码形式的 Three.js 3D 模型;Sol 还在一次运行中独立生成了曼哈顿的体素式 3D 渲染图,这些被引用为相比 GPT-5.5 空间推理能力提升的证据。
- 03.xAI/SpaceXAI 的 Grok 4.5 于 2026 年 7 8 日发布,是一款混合专家模型,与 Cursor 共同使用真实开发者交互数据进行训练,旨在在长时间的多文件编码会话中保持连贯性,并以低于 Sol 的激进定价推出。
价格战:Grok 压价,OpenAI 以效率回应
竞争焦点已从单纯的能力转向每单位产出的成本。Grok 4.5 的定价为每百万输入 token 2 美元、每百万输出 token 6 美元,约为 Sol 定价(5 美元/30 美元)的三分之一,并据报道在接近前沿速度下将编码代理成本降低约 80%,尽管其幻觉率较高已被标记 [7]。OpenAI 的应对策略是 token 经济性:它声称 Sol 在 AI 编码任务中 token 效率高出 54%,并在某编码基准测试中以不到先前领先者一半的输出 token 数量创下新纪录 [1]。与此同时,据报道 Grok 在 SWE Bench Pro 上使用的输出 token 数量比此前最强的前沿模型少约 4.2 倍 [3],这意味着一旦按模型实际消耗的 token 定价,实际价格差距会显著缩小。
Cursor 既是 Grok 4.5 的护城河,也是其隐患
数据对比
在综合基准测试中,两款模型的表现比营销宣传更接近。Sol 在总体综合得分上以 86 比 82 领先,代理式任务平均得分为 92.0 比 83.3,包括 Terminal-Bench 2.0 的 91.9% 对比 83.3% [6]。但在纯编码平均得分上,Grok 4.5 以 64.7 比 64.6 略微领先 [6]。Sol 拥有约 100 万 token 的更大上下文窗口,而 Grok 为 50 万;而在价格方面,Grok 以 2 美元/6 美元对 Sol 的 5 美元/30 美元取得压倒性优势 [6]。结论是:Sol 主导代理式和长上下文任务,Grok 在成本敏感型编码上以相当的准确率胜出,选择哪款模型完全取决于你的工作负载更依赖哪个维度。
历史背景
关键关系图
事实来源
[1] OpenAI launches its new family of models with GPT-5.6
[2] OpenAI's GPT-5.6 Sol builds a 3D Manhattan in one shot
[3] SpaceXAI Releases Grok 4.5
[4] Grok 4.5
[5] What is Grok 4.5: xAI's Cursor-trained coding model
[6] GPT-5.6 Sol vs Grok 4.5
[7] Grok 4.5 Cuts Coding Agent Cost 80% at Near-Frontier Speed but Higher Hallucinations
来源文章
THE SIGNAL.
“Grok 4.5 "能够处理需要创造性使用工具来解决问题的复杂、长时间运行的任务",由 SpaceXAI 与 Cursor 联合使用数万亿 token 的 Cursor 数据进行训练。”
“Grok 4.5 是"一种基于开发者实际工作方式而非仅代码表面形式的编码模型",旨在在长时间会话中保持连贯性,使行为在任务演进过程中保持一致。”
“1/ Someone built a tool with GPT-5.6 Sol that takes a photo of any object and rebuilds it as a pure code-based Three.js 3D model.”
“Grok 4.5: $2 in / $6 out GPT 5.6: $5 in / $30 out Opus 4.8: $5 in / $25 out Grok 4.5 seriously is freaking good price-performance wise. Opus 4.8 level, Sonnet 5 pricing”
“Did more testing. I'm honestly impressed by Grok 4.5. Definitely was not on my list of models to be excited about this week. Well, I guess only GPT 5.6 Sol was on that list... And Fable, of course. Anyways, Grok 4.5 is really, really good! At implementing (it's fast) but also”
“GPT-5.6 Sol is the real deal.”

A Model Explosion: GPT 5.6 Sol, Grok 4.5 and Meta Muse Rewrite the Rules

GPT-5.6 IS OUT! GLM 5.5 Is Mythos Level, U.S Governement Banning AI Cause of Dario?, & Grok 4.5!

GPT 5.6 VS Claude Fable 5 VS Grok 4.5 (Honest Results)