OpenAI GPT-5.6 Sol Ultrafast模式
TECH

OpenAI GPT-5.6 Sol Ultrafast模式

30+
Signals

战略概览

  • 01.
    OpenAI正在预览Ultrafast这一新型处理层级,它可在Cerebras的晶圆级引擎芯片(而非GPU)支持下,以最高达标准处理模式14倍的速度运行完整的GPT-5.6 Sol模型,每秒生成最多750个输出token。
  • 02.
    Ultrafast在与标准处理模式相同的智能水平下运行同一完整版GPT-5.6 Sol模型,因此OpenAI将其定位为消除了以往必须在小型快速模型与大型智能模型之间进行选择的传统权衡。
  • 03.
    该模式目前仅向少数精选客户开放预览,这些客户正在生产环境中测试其在编程、商业交易、金融研究和支持类工作负载中的应用;其他企业可通过提交其工作负载、延迟要求和使用详情加入候补名单,随着容量扩展逐步获得访问权限。
  • 04.
    Ultrafast位于OpenAI现有的Fast Mode(速度约2.5倍,价格约为两倍)之上,首次为API引入了三层次的速度与定价结构。

速度成为可定价的产品层级,但无人知晓价格

Ultrafast将推理速度本身转变为一种可货币化的杠杆,置于现有Fast Mode层级(约2.5倍速度,价格大致翻倍)之上,首次构建出一个三维的速度与价格阶梯[4]。这种结构模仿了云计算的定价模式,在其中计算密集型性能被单独计量而非捆绑销售,并契合OpenAI所宣称的目标:匹配实时人类工作流,而无需降级至更小的模型[1]。问题在于,OpenAI尚未公布Ultrafast的具体价格,发布材料强调的是能力声明(14倍速度、同等智能),而非成本[2]。考虑到现有的2.5倍速Fast Mode价格已是标准模式的大约两倍,那么在同一基础模型上运行速度接近Fast Mode六倍的新层级,自然引发人们对其最终定价以及经济可行性适用对象的疑问。

专为芯片构建,而非简单附加

Ultrafast背后的核心机制是架构层面的创新,而不仅仅是增加更多硬件:Cerebras的晶圆级引擎将模型权重完全保留在每块晶圆级芯片44 GB的SRAM中,避免了GPU推理中因频繁在片上与片外内存之间传输数据而导致的主要延迟瓶颈[3]。正是由于这种片上内存设计,完整的、具备全部智能的GPT-5.6 Sol模型才能以每秒高达750个token的速度运行,而无需缩小模型或牺牲质量[2][3]。发布后独立技术评论进一步推测,GPT-5.6 Sol的架构可能从一开始就围绕晶圆级内存带宽限制进行设计,而非事后适配——尽管这些具体架构细节尚属未经证实的估计,而非官方披露的规格,应视为有根据的推测,而非事实。

直接对标Anthropic的基准挑战

Cerebras与OpenAI明确将此次发布定位为对Anthropic产品的直接回应,声称Ultrafast在速度上比Fable 5快11倍,比Opus 4.8的Fast模式快5倍[3]。最具体的证据来自“人类最后考试”测试(包含2,500道博士级别问题),GPT-5.6 Sol Ultrafast耗时11小时11分钟完成,而对比模型耗时78小时27分钟,完成时间优势约为7倍[3]。媒体普遍将此视为推理速度竞赛中的直接竞争信号,如今速度正与准确性并列为企业竞争的核心维度之一[2]。由于这些比较由OpenAI与Cerebras自行运行,而非第三方基准测试,相关数据应被视为附带实质性细节的营销主张,而非独立验证的结果。

受限发布意味着市场影响仍属理论

尽管速度宣称激进,Ultrafast目前仅对少数预览客户开放,更广泛的访问权限将随Cerebras产能增长而逐步开放,企业需通过描述其工作负载、延迟需求和预期使用情况加入候补名单[4][5]。官方列出的目标用例——包括需要实时日志与代码分析的事件响应、金融市场分析与欺诈检测、多步骤客户服务、实时库存商业交易,以及将隔夜批处理研究转化为当日交互式会话——均为对延迟敏感的企业级工作流,而非面向消费者的特性[4][5]。这意味着Ultrafast的短期影响更多取决于OpenAI与Cerebras能否快速扩大晶圆产能以清空候补名单,而非底层技术本身是否如宣称般有效。

演示背后的750兆瓦豪赌

Ultrafast是建立在一个更大承诺之上的首款面向客户的产品:据报双方已达成一项多年合作,预计投入超过100亿美元,在2026年至2028年间部署750兆瓦的Cerebras晶圆级系统用于高速推理,被称为全球规模最大的高速AI推理部署[7][8]。如此规模的投资反映了OpenAI推动推理基础设施多元化、摆脱GPU主导供应商的战略,旨在增添专用的低延迟能力,而非简单采购更多同类算力[6][7]。两家公司的关系可追溯至2017年团队间的非正式协作,因此Ultrafast更像是近十年软硬件协同规划的首个可见成果,而非突然的战略转向[6]

历史背景

两家公司团队据报开始频繁会面,共享研究成果,并预见模型规模与晶圆级硬件架构未来的融合。
OpenAI与Cerebras签署了一项多年合作协议,据报价值超过100亿美元,计划在2026年至2028年间部署750兆瓦的Cerebras晶圆级系统用于高速推理,被称为全球规模最大的高速AI推理部署。
OpenAI推出了GPT-5.6模型系列:Sol(最智能)、Terra(均衡型)和Luna(专注速度)。
GPT-5.6模型系列在ChatGPT、Codex及API中全面上线。
OpenAI预览了GPT-5.6 Sol的Ultrafast模式;Cerebras同步发布配套博客文章,包含基准对比及底层架构的技术细节。

关键关系图

关键玩家
主题

OpenAI GPT-5.6 Sol Ultrafast模式

OP

OpenAI

模型开发者与API提供商,推出Ultrafast作为GPT-5.6 Sol的新处理层级

CE

Cerebras Systems

硬件合作伙伴,根据与OpenAI的多年计算协议,提供驱动Ultrafast推理的晶圆级引擎芯片

SA

Sachin Katti, OpenAI Head of Compute Infrastructure

将Cerebras合作关系描述为为OpenAI计算战略增添专用低延迟基础

AN

Andrew Feldman, Cerebras co-founder and CEO

认为实时推理速度将变革人们构建和交互AI模型的方式

AN

Anthropic

被引用为基准目标的竞争者,Ultrafast宣称在速度上超越Anthropic的Fable 5和Opus 4.8 Fast模式

事实来源

8 条引用
  1. [1] Previewing Ultrafast
  2. [2] OpenAI introduces Ultrafast, a new mode that makes GPT-5.6 Sol work at 14x the speed
  3. [3] Accelerating GPT-5.6 Sol Ultrafast with OpenAI
  4. [4] GPT-5.6 Sol goes 14x faster as OpenAI launches Ultrafast mode powered by Cerebras
  5. [5] OpenAI previews Ultrafast GPT-5.6 Sol running up to 14 times faster
  6. [6] OpenAI Partners With Cerebras to Deploy 750MW Wafer-Scale Systems for High-Speed Inference
  7. [7] OpenAI Partners with Cerebras to Deliver Faster AI Inference
  8. [8] OpenAI signs $10 billion deal with Cerebras with 750MW of big chip compute

来源文章

Top 5

THE SIGNAL.

Analysts

将Ultrafast描述为让AI能够跟上人类工作流节奏,而非滞后于其后,并将速度提升直接归功于与Cerebras的合作关系。

Rohan Varma, OpenAI Product
OpenAI代表

描述了消除等待时间带来的具体生产力效应:输出结果返回时,用户尚未在思维上转移至其他任务。

Jeffrey Wang, OpenAI Researcher
Ultrafast内部早期用户

将Cerebras合作关系定位为OpenAI整体算力多元化战略中,专为低延迟推理打造的专用且专业化基础。

Sachin Katti, OpenAI Head of Compute Infrastructure
OpenAI基础设施领导层

认为实时推理速度是一项跨越式能力,而非渐进式性能提升,将开启构建和交互AI的新方式。

Andrew Feldman, Cerebras co-founder and CEO
Cerebras领导层
The Crowd

Previewing Ultrafast mode: GPT-5.6 Sol at up to 14x the speed. Launching first in the OpenAI API to a select group of customers with expanded access to more businesses as capacity grows. https://t.co/a5dleofiDJ

@@OpenAI14272

Previewing Ultrafast mode for @OpenAI's GPT 5.6 Sol, powered by Cerebras. GPT-5.6 Sol Ultrafast generates responses at up to 750 tokens per second. That's the full, GPT-5.6-Sol model -- up to 14× faster than the same model on Standard processing. It speedran Humanity's Last... https://t.co/jkwbl6Tl4z

@@cerebras4208

Ultrafast mode for GPT-5.6 Sol is now in limited preview, powered by Cerebras. We gave @OpenAI's GPT-5.6 Sol the same prompt on Ultrafast and Standard: build a financial terminal-style dashboard for analysts. Ultrafast: 1 min 50 seconds Standard: 12 min 20 seconds Same result,... https://t.co/LgchIPue8b

@@cerebras1921

GPT-5.6 Sol can run now at an incredible rate of ~750 tokens per second

@u/ProxyLumina494
Broadcast
Why OpenAI Chose Cerebras Over NVIDIA for GPT-5.6 Sol

Why OpenAI Chose Cerebras Over NVIDIA for GPT-5.6 Sol

OpenAI introduces new Ultrafast mode for GPT‑5.6 Sol delivering 14x faster tokens

OpenAI introduces new Ultrafast mode for GPT‑5.6 Sol delivering 14x faster tokens

GPT-5.6 Explained: 3 Models: 91.9% Benchmark, 750 Tokens/Sec, $30 Per 1K

GPT-5.6 Explained: 3 Models: 91.9% Benchmark, 750 Tokens/Sec, $30 Per 1K

OpenAI GPT-5.6 Sol Ultrafast模式 — AI 新闻 | Agentic Brew