实现每秒750个token的晶圆级技术奥秘
Ultrafast最引人注目的数据——推理速度最高提升14倍,峰值达到每秒约750个输出token [1]——并非通过缩小模型实现。它运行的是相同的GPT-5.6 Sol模型,但所用硬件绕过了通常限制大语言模型性能的瓶颈:内存带宽。在标准GPU集群中,每个token生成时都需要在片外内存和处理核心之间来回传输权重。而Cerebras的晶圆级引擎则将44 GB的SRAM直接集成在每块晶圆级芯片上 [1],使模型权重紧邻计算单元,无需排队等待总线传输。OpenAI将这一成果描述为一种无取舍的扩展方式:‘在此之前,实现实时响应通常意味着必须选择更小或更专用的模型。Ultrafast则指向了一个新方向的发展:每秒完成更多有用的工作。’ [2]
基准测试数据支持这一说法。在GDP-Val这一涵盖法律简报和财务模型等经济价值知识型任务的测试套件中,Ultrafast实现了5.6倍的端到端加速,且未检测到质量下降 [1]。在包含2,500道题的“人类最后考试”(Humanity's Last Exam)基准测试中,Ultrafast耗时11小时11分钟完成全部题目,而Anthropic的Claude Fable 5在相近准确率下耗时78小时27分钟——相当于墙钟时间相差约7倍 [1]。这一差距比单纯的每秒token数更重要:它意味着一次基准测试可以从过夜完成缩短至午饭前完成。



