一个无人能完全验证的10倍数字
NVIDIA对Vera Rubin的核心宣传集中在一个倍数上:在大规模部署下,智能体吞吐量相较上一代Grace Blackwell平台提升10倍[1],而当Groq 3 LPX与Vera Rubin NVL72结合后,预计在运行长上下文、低延迟工作负载的千亿参数以上模型时,每兆瓦的推理吞吐量将提升35倍[2]。NVIDIA将Vera Rubin定位为应对下一波AI建设周期中每token能耗与延迟这一核心瓶颈的解决方案,该平台有望打开约2000亿美元的可寻址市场[3]。
然而问题在于,这一数字并非真正意义上的同构芯片对比,网络舆论也由此分裂为两派。Reddit上r/nvidia板块关于该公告的热门评论将NVIDIA的数据斥为“宣传噱头”,认为这一显著提升并未反映底层芯片的普遍飞跃,而是部分归功于“一个现已集成在机架上的专用LPU,由Groq与NVIDIA合作开发”,该LPU是外挂于机架而非直接集成在Rubin GPU芯片内部。这种解读与实际对比方式一致:10倍数据是将包含Rubin GPU和以约200亿美元收购的专用推理芯片的异构机架[4],与上一代纯GPU系统进行对比,这与直接的制程节点比较是不同的衡量方式。
但质疑声并非全貌。独立云服务商CoreWeave已在生产环境中运行Vera Rubin NVL72,并引用了其自身实测结果,而非预测数据:在DeepSeek-R1模型上,每兆瓦每秒生成的token数相较上一代Blackwell提升了约10倍。这与NVIDIA自身的营销声明性质截然不同,是真实部署中的实际数据,直接挑战了Reddit社区“纯属宣传”的结论。最终,真相更接近厂商宣传还是社区质疑,可能要等到除NVIDIA首发合作伙伴外的更多运营商公布实测数据后才能揭晓。



