谁的Blackwell?尚未决出的基准之争
OpenAI的核心主张非常明确:在运行GPT-OSS 120B、DeepSeek的R1和月之暗面AI的Kimi K2.5时,Jalapeño相比英伟达Blackwell代GB300系统每瓦AI工作量高出1.5倍至1.9倍,延迟低1.7倍至3.6倍[1]。特别是在DeepSeek R1上,OpenAI报告在低并发下每位用户每秒可输出超过700个token,在GPT-OSS上接近每秒1,400个token——值得注意的是,这并未使用多token预测这一常见提速技巧,而竞争对手在其对比数据中据称使用了该技术[2]。
但这些数据的来源也正是最响亮质疑的出处。提供InferenceX基准测试套件的SemiAnalysis在其自己的通讯中写道,将Jalapeño与Blackwell比较是‘某种程度上不完整且不公平的’,因为英伟达当前实际的继任产品Rubin才是更合适的对手[2]。社区基准测试讨论进一步指出,Jalapeño自身的测试据称排除了推测性解码(speculative decoding)——即提前预测多个token以节省时间的技术——而OpenAI对Rubin的比较却似乎包含了该技术。如果属实,这种不对称会低估Jalapeño的真实优势,一旦方法论统一,差距可能更大。这也意味着目前除OpenAI外无人真正执行过这种标准化测试。SemiAnalysis自身也承认,它尚未独立运行完整的InferenceX套件,也未看到用于反映真实生产级代理工作负载的AgentX基准结果[2]。在外部机构未在相同条件下对相同模型发布数据前,‘击败英伟达’这一说法完全依赖于主张方自身的测试框架。


