NVIDIA Vera Rubin NVL72的MLPerf推理v6.1首秀
TECH

NVIDIA Vera Rubin NVL72的MLPerf推理v6.1首秀

23+
Signals

战略概览

  • 01.
    NVIDIA于2026年9月16日公布了其MLPerf推理v6.1的提交结果,其中最引人注目的是其Vera Rubin NVL72系统的首次MLPerf推理预览提交,在Qwen3-VL基准测试中吞吐量最高达到GB300 NVL72的3.7倍。
  • 02.
    NVIDIA为Vera Rubin NVL72提交了两项最具挑战性的基准测试预览结果,在使用TensorRT-LLM的DeepSeek-R1测试中,其token吞吐量最高比GB300 NVL72高出2.5倍;在使用vLLM与NVIDIA Dynamo的Qwen3-VL测试中,最高高出3.7倍。
  • 03.
    本轮测试共有五款新处理器或加速器首次亮相MLPerf,Vera Rubin NVL72被列为预览类别(尚未商业化)参赛者,来自创纪录的30家提交机构,共提交了486项数据中心和边缘端结果。
  • 04.
    Vera Rubin的性能提升源于增强的张量核心(Tensor Cores)和Transformer引擎,可加速prefill和decode阶段,再加上NVFP4精度技术,缩小了模型权重、注意力机制和KV缓存的内存占用。

深度分析

Vera Rubin为何胜出:NVFP4精度与专用硅芯片的结合

Vera Rubin NVL72相对于GB300 NVL72的吞吐量优势,源于硬件与软件的协同改进,而非单一技巧。NVIDIA表示,其增强的张量核心和Transformer引擎加速了推理的prefill和decode两个阶段,而NVFP4精度则缩小了模型权重、注意力机制和KV缓存的内存占用——从而在输出质量几乎无损的情况下提升吞吐量[1]。这些软件增益建立在一个集成了72颗Rubin GPU和36颗Vera CPU的机架之上,配备20.7 TB HBM4 GPU内存、1,400 TB/s GPU内存带宽和216 TB/s NVLink带宽,NVFP4推理算力达3,600 PFLOPS[2]。DeepSeek-R1的结果(2.5倍)在离线、服务器和交互场景下均通过TensorRT-LLM实现,而更大的Qwen3-VL增益(3.7倍)则使用了vLLM与NVIDIA Dynamo的组合——这提醒我们,所宣称的飞跃实际上是针对不同工作负载形态优化的两套独立堆栈,而非一个通用倍数。

预览类别的策略:为何要测试尚未上市的硬件

MLPerf的预览类别适用于预计在下一轮提交前实现商业化的平台,NVIDIA借此机会在GB300 NVL72仍是客户唯一可购买的Rubin时代产品时,就将Vera Rubin NVL72的性能数据公之于众[3]。这是一种有意的策略:在通用上市前,先发布经第三方验证的下一代平台性能上限,使云服务商客户能据此规划资本支出,而非仅依赖营销材料。Nebius是这一策略获得客户认可的最明显证据——这家云服务商自行提交了Vera Rubin NVL72的预览结果,并承诺从2026年下半年起在美国和欧洲提供该平台的商业化服务[4]。这也是一种对比策略:NVIDIA直接将Vera Rubin的预览成绩与GB300 NVL72在MLPerf v6.0中的记录进行对比——后者在四机架、288 GPU配置下,在DeepSeek-R1测试中实现了每秒250万token的吞吐量,是当时五年历史中规模最大的提交记录[5]。Vera Rubin的预览首秀,几乎立即将这一纪录定义为上一代产品。

AMD与Intel在NVIDIA领先时缩小差距

NVIDIA的预览数据是本轮焦点,但同一轮v6.1测试也悄然展示了AMD和Intel如何更接近NVIDIA现有产品的性能。AMD首次提交了Instinct MI350P和Ryzen AI Max+ 395的MLPerf结果,并与Crusoe合作,在标准RoCE以太网上运行了由64个节点组成的512颗Instinct MI355X GPU集群——这是MLPerf推理测试史上最大规模的提交,在gpt-oss-120b测试中离线吞吐量达每秒575万token,服务器场景达每秒539万token[6]。与此同时,Intel也首次亮相MLPerf,提交了Arc Pro B70 GPU的结果,在Llama 3.1 8B、Llama 2 70B、gpt-oss-120B、Whisper以及新的端到端RAG基准测试中均实现了代际性能提升。本轮测试共吸引了创纪录的30家提交机构,总计486项数据中心和边缘端结果[7],MLCommons在本周期特别加入了端到端RAG测试,因为部署模式已超越单轮问答,而这正是Vera Rubin NVL72架构所针对的场景[6]。NVIDIA仍处于领先地位,但就在其预览下一代平台的同时,竞争对手的追赶步伐也明显加快。

细读数据:当百倍提升并非真实数字

本轮最受关注的数字其实并非来自MLPerf本身:Vera Rubin NVL72在第三方测试SemiAnalysis AgentX基准中,性能比GB300 NVL72高出30倍,该测试专为衡量代理型工作负载设计[8]。如此巨大的倍数自然引发了投资者圈内的质疑,有讨论线程总结了一项相关的SemiAnalysis每美元性能分析,声称在高交互性服务级别下,总拥有成本的token产出是GB300的数十倍。但同一讨论中也有评论者反驳称,这些头条倍数‘仅在高交互性且基线极低的情况下成立’,意味着一旦转向典型中等吞吐量部署,这些引人注目的比率会急剧缩小。这种张力——一边是真实、经验证的架构提升,另一边是最佳情况下的营销倍数——正是解读此次发布所有数据的诚实方式:2.5倍和3.7倍的MLPerf数据是经过同行评审且可复现的,而围绕Vera Rubin流传的更夸张的双位数甚至三位数倍数,则高度依赖于所测量的工作负载曲线的特定切片。

历史背景

在2026年国际消费电子展(CES)上发布了Rubin平台,包括Vera Rubin NVL72,作为Blackwell的继任者。
在MLPerf推理v6.0中创下纪录,以288 GPU、四机架配置在DeepSeek-R1测试中实现每秒250万token的吞吐量,是当时五年历史中规模最大的提交。
在v6.1轮次中首次提交预览类别MLPerf推理结果,同期首次提交的还有AMD Instinct MI350P、Intel Arc Pro B70和AMD Ryzen AI Max+ 395。

关键关系图

关键玩家
主题

NVIDIA Vera Rubin NVL72的MLPerf推理v6.1首秀

事实来源

8 条引用
  1. [1] NVIDIA Blog: Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut
  2. [2] NVIDIA: Vera Rubin NVL72 Data Center Platform
  3. [3] MLCommons: MLPerf Inference v6.1 Results
  4. [4] Nebius Newsroom: Nebius to Offer NVIDIA Vera Rubin NVL72 in US and Europe from H2 2026
  5. [5] NVIDIA Blog: MLPerf Inference Blackwell Ultra (v6.0)
  6. [6] StorageReview: MLPerf Inference v6.1 - 5.7x Per-Accelerator Gains, a 512-GPU Run, and Vera Rubin's First Peer-Reviewed Numbers
  7. [7] GlobeNewswire: MLCommons Sets Participation Record With New MLPerf Inference v6.1 Benchmark Results
  8. [8] Unite.AI: NVIDIA Vera Rubin NVL72 Posts First MLPerf Inference Preview Results

来源文章

Top 3

THE SIGNAL.

Analysts

将新的端到端RAG测试描述为AI部署场景已超越简单LLM问答的体现:‘我们加入端到端RAG测试,是因为很明显,问答已不再只是在一个语料库上训练的LLM。’他补充说,基准测试套件的目标是追踪业界真正关心的内容:‘我们正努力确保MLPerf推理基准继续反映AI社区最重视的场景。’

Miro Hodak
MLPerf推理工作组联合主席,MLCommons

将专用基础设施定位为代理型AI时代的要求:‘在代理型AI时代领先,需要为规模、性能、可靠性和成本效率而专门构建的基础设施。’

Dave Salvator
NVIDIA加速计算产品总监
The Crowd

Five first-place results in MLPerf® Inference v6.1. 603,023 tokens/sec on DeepSeek R1 at 72 GPUs and preview-category results on the Nebius @nvidia Vera Rubin NVL72. We were one of only two submitters with results on that hardware. Full results: nebius.com/blog/posts/mlperf-inference-v6-1-results #MLPerf

@@nebiusai158

Nvidia Vera Rubin NVL72 debuts in MLPerf Inference In its first MLPerf Inference v6.1 preview, Nvidia said Vera Rubin NVL72 delivered up to 3.7x higher throughput than GB300 NVL72 on Qwen3-VL, and up to 2.5x on DeepSeek-R1

@@onlycapex0

NVIDIA's Vera Rubin NVL72 just debuted in MLPerf Inference v6.1: up to 3.7x higher throughput than GB300 NVL72 on Qwen3-VL, and up to 2.5x on DeepSeek-R1. Preview results posted today. https://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/

@@ProLogicaAI0

NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut

@u/bl079725
Broadcast
NVIDIA Unveils Vera Rubin: The World's Most Powerful AI Supercomputer | CES 2026 NVIDIA | AI14

NVIDIA Unveils Vera Rubin: The World's Most Powerful AI Supercomputer | CES 2026 NVIDIA | AI14

NVIDIA Vera Rubin NVL72 production racks are here.

NVIDIA Vera Rubin NVL72 production racks are here.

2026 Best Choice of the Year: NVIDIA Vera Rubin NVL72 - The Peak of AI Supercomputing

2026 Best Choice of the Year: NVIDIA Vera Rubin NVL72 - The Peak of AI Supercomputing