OpenAI的Ultrafast模式利用Cerebras晶圆级硬件使GPT-5.6 Sol的运行速度最高提升14倍,目前正处于API有限预览阶段。
TECH

OpenAI的Ultrafast模式利用Cerebras晶圆级硬件使GPT-5.6 Sol的运行速度最高提升14倍,目前正处于API有限预览阶段。

20+
Signals

战略概览

  • 01.
    OpenAI正在为GPT-5.6 Sol推出一种名为Ultrafast的新服务层级,其推理速度比标准处理快高达14倍,最初仅通过OpenAI API向部分客户开放预览。
  • 02.
    Ultrafast每秒可生成多达750个输出token,由Cerebras的晶圆级引擎(Wafer-Scale Engine)硬件驱动,该硬件在每块晶圆级芯片上直接集成了44 GB的SRAM。
  • 03.
    双方于2026年8月13日联合宣布这一消息;目前为有限预览,随着容量增长将逐步扩大访问范围,企业可通过提交工作负载、延迟和使用详情加入候补名单。
  • 04.
    在GDP-Val这一衡量经济价值知识型任务(如法律简报和财务模型)的基准测试中,Ultrafast实现了5.6倍的端到端加速,且质量无损失。

深度分析

实现每秒750个token的晶圆级技术奥秘

Ultrafast最引人注目的数据——推理速度最高提升14倍,峰值达到每秒约750个输出token [1]——并非通过缩小模型实现。它运行的是相同的GPT-5.6 Sol模型,但所用硬件绕过了通常限制大语言模型性能的瓶颈:内存带宽。在标准GPU集群中,每个token生成时都需要在片外内存和处理核心之间来回传输权重。而Cerebras的晶圆级引擎则将44 GB的SRAM直接集成在每块晶圆级芯片上 [1],使模型权重紧邻计算单元,无需排队等待总线传输。OpenAI将这一成果描述为一种无取舍的扩展方式:‘在此之前,实现实时响应通常意味着必须选择更小或更专用的模型。Ultrafast则指向了一个新方向的发展:每秒完成更多有用的工作。’ [2]

基准测试数据支持这一说法。在GDP-Val这一涵盖法律简报和财务模型等经济价值知识型任务的测试套件中,Ultrafast实现了5.6倍的端到端加速,且未检测到质量下降 [1]。在包含2,500道题的“人类最后考试”(Humanity's Last Exam)基准测试中,Ultrafast耗时11小时11分钟完成全部题目,而Anthropic的Claude Fable 5在相近准确率下耗时78小时27分钟——相当于墙钟时间相差约7倍 [1]。这一差距比单纯的每秒token数更重要:它意味着一次基准测试可以从过夜完成缩短至午饭前完成。

速度成为对抗Anthropic竞争的新维度

Cerebras和OpenAI发布的不仅是孤立的速度数据——他们明确将目标对准了Anthropic。引用Artificial Analysis的输出速度数据,两家公司表示Ultrafast的运行速度约为Claude Opus 4.8 Fast模式的5倍,是Claude Fable 5的11倍 [1]。Cerebras首席执行官Andrew Feldman直言不讳地表示:‘GPT-5.6 Sol在Ultrafast上的表现证明,速度与智能不再相互排斥。’ [1]TechCrunch [3]和9to5Mac [4]的报道均以14倍这一数字作为标题,表明推理速度正与基准准确率一样,成为前沿实验室之间可营销的差异化特征。

这一成就并非一蹴而就。OpenAI与Cerebras早在2026年1月就签署了一项多年协议,计划在2028年前分阶段向OpenAI的推理堆栈部署最多750兆瓦的晶圆级系统 [5][6]。Ultrafast正是这一基础设施投入的首个可见成果,七个月后伴随正式新闻稿一同发布 [7]。这一时间安排表明,OpenAI认为原始生成速度是一个值得专门进行硬件合作的战略短板,而非仅靠软件即可解决的问题。

现实应用场景:从小时级等待到转眼即达

OpenAI对Ultrafast的宣传聚焦于那些因模型响应过慢而崩溃的工作流:语音应用、客户服务、电子商务、开发代理、金融研究、事件响应以及网络安全威胁检测 [2]。内部数据显示,过去需要一到两个小时才能完成的事件响应调查,现在在Ultrafast上只需十到十五分钟即可解决。一位研究人员描述称,模型回复在他切换任务之前就已经返回 [1]——这虽是细节,却极具说服力,因为真正拖累生产力的往往不是原始算力,而是缓慢AI工具带来的上下文切换成本。

非官方渠道的反馈总体上支持这一观点,但也存在保留意见。早期试用者将GPT-5.6 Sol在Ultrafast上的表现形容为快速可靠的主力工具,而非原始智能的飞跃,并指出这是5.6系列中首个足够可靠、可独立运行自主子代理任务的模型。这一区别决定了加速的实际价值所在:随着越来越多工作流涉及并行子代理发起大量小型请求而非单一长对话,瓶颈已从模型有多聪明转变为响应有多快——而这正是Ultrafast旨在填补的空白。

当前为预览版,定价尚未公布

截至目前,Ultrafast的一切都处于预览状态:首先通过OpenAI API向少数客户开放,尚无公开定价,未来将随容量增长逐步扩大访问范围 [2]。希望参与的企业需加入候补名单,并说明其工作负载、延迟要求和预期使用情况 [4]。这种准入机制至关重要,因为如此高速的服务显然成本高昂——晶圆级芯片比通用GPU更为稀缺且昂贵——但两家公司均未透露14倍加速对终端用户的具体收费。

正是在这种信息真空下,公众反应趋于怀疑。在缺乏官方定价的情况下,外界讨论从对底层硬件成就的真诚赞赏,到尖锐的成本焦虑,甚至怀疑标准模式的响应是否被故意放慢,以使付费高速层级显得更具价值——这一指控尚未得到OpenAI或Cerebras的回应。另一些人则认为,真正的瓶颈根本不在模型速度:随着并行子代理工作流的普及,本地基础设施如编译器和CPU吞吐量可能成为新的制约因素,无论模型本身响应多快。这两种批评都指向同一个未解之问——Ultrafast究竟是AI使用方式的一次真正变革,还是一个受容量限制的展示品,其真正考验只有在定价和可用性全面开放后才会到来。

历史背景

OpenAI与Cerebras签署多年协议,计划在2028年前分阶段向OpenAI的推理堆栈部署最多750兆瓦的Cerebras晶圆级系统,为Ultrafast奠定了基础设施基础。
OpenAI推出了GPT-5.6模型家族(Sol、Terra、Luna),其中Sol定位为能力最强的变体,Luna则专注于速度。
OpenAI与Cerebras联合宣布GPT-5.6 Sol的Ultrafast预览版,并同步发布了博客文章和新闻稿。

关键关系图

关键玩家
主题

OpenAI的Ultrafast模式利用Cerebras晶圆级硬件使GPT-5.6 Sol的运行速度最高提升14倍,目前正处于API有限预览阶段。

OP

OpenAI

Developer of GPT-5.6 Sol and the Ultrafast mode; controls API access and rollout pace, positioning Ultrafast for latency-sensitive workflows like voice, customer support, developer agents, and financial research.

CE

Cerebras Systems

Hardware and infrastructure partner powering Ultrafast via its Wafer-Scale Engine, part of a broader multi-year deal to deploy up to 750 megawatts of wafer-scale systems into OpenAI's inference stack through 2028.

AN

Anthropic

Competitor whose Claude Opus 4.8 and Claude Fable 5 models are used as the explicit speed-benchmark comparison for Ultrafast's marketing claims.

AR

Artificial Analysis

Independent benchmarking firm whose output-speed comparisons are cited as the basis for the 5x and 11x speed claims against Claude models.

事实来源

7 条引用
  1. [1] Accelerating GPT-5.6 Sol Ultrafast with OpenAI
  2. [2] Previewing Ultrafast
  3. [3] OpenAI introduces Ultrafast, a new mode that makes GPT-5.6 Sol work at 14x the speed
  4. [4] OpenAI previews Ultrafast GPT-5.6 Sol, running up to 14 times faster
  5. [5] Cerebras Lands Major OpenAI Deal to Scale AI Inference
  6. [6] OpenAI Partners with Cerebras to Deploy 750MW Wafer-Scale Systems for High-Speed Inference
  7. [7] Cerebras Powers Ultrafast Mode for OpenAI's GPT-5.6 Sol

来源文章

Top 1

THE SIGNAL.

Analysts

将Ultrafast视为原始模型智能与推理速度不再需要权衡的证据:‘GPT-5.6 Sol在Ultrafast上的表现证明,速度与智能不再相互排斥。’

Andrew Feldman
Cerebras首席执行官兼联合创始人

将Ultrafast定位为使AI响应速度匹配人类思维与编码工作节奏:‘借助GPT-5.6 Sol Ultrafast,Cerebras让AI能够跟上你的思考与编码速度。’

Rohan Varma
OpenAI产品经理

描述了亲身工作流程的改进:Ultrafast的回复在他切换任务之前就已经返回:‘以前我可能需要等待几分钟,现在在我上下文切换前就已经完成了。’

Jeffrey Wang
OpenAI研究员
The Crowd

Previewing Ultrafast mode: GPT-5.6 Sol at up to 14x the speed. Launching first in the OpenAI API to a select group of customers with expanded access to more businesses as capacity grows.

@@OpenAI11329

Previewing Ultrafast mode for @OpenAI's GPT 5.6 Sol, powered by Cerebras. GPT-5.6 Sol Ultrafast generates responses at up to 750 tokens per second. That's the full, GPT-5.6-Sol model -- up to 14x faster than the same model on Standard processing. It speedran Humanity's Last

@@cerebras3226

GPT-5.6-Sol Ultrafast mode (750 TPS) is here powered by Cerebras! Here's How kernels work on Cerebras Chips cerebras built a chip with 900,000 cores on a single silicon wafer. CSL (Cerebras Software Language) is a Zig-inspired DSL that gives you direct control over the

@@wafer_ai509

Previewing Ultrafast mode: GPT‑5.6 Sol at up to 14X the speed

@u/YeXiu223217
Broadcast
Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed

Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed

I Tested GPT-5.6 Sol for a Month

I Tested GPT-5.6 Sol for a Month

Finally GPT 5.6 Sol Ultra Inside Codex (750 Token/Sec) | GPT 5.6 sol updates | GPT 5.6 + Codex

Finally GPT 5.6 Sol Ultra Inside Codex (750 Token/Sec) | GPT 5.6 sol updates | GPT 5.6 + Codex