Nvidia的Vera Rubin与Groq推理建设推动代理式AI发展
TECH

Nvidia的Vera Rubin与Groq推理建设推动代理式AI发展

51+
Signals

战略概览

  • 01.
    Nvidia通过收购Groq而推出的交互式AI推理芯片Groq 3 LPX推理加速器已于2026年8月24日进入全面生产阶段,在长上下文基准测试中实现了每秒3,400个输出token的创纪录表现。
  • 02.
    Vera Rubin平台——包括Rubin GPU、Vera CPU以及五款配套芯片——正逐步进入全面生产,预计今年秋季开始向客户发货。
  • 03.
    Nvidia声称其Vera Rubin NVL72机架的代理吞吐量可达上一代Grace Blackwell平台的10倍,且GPU数量更少,每个token的成本也更低。
  • 04.
    NVLink Fusion现允许外部芯片制造商将其定制的XPUs和CPU接入Nvidia的机架基础设施,其中Intel正在构建x86 CPU,而三星电子代工厂(Samsung Foundry)则作为最终定制芯片的制造合作伙伴。

深度分析

三颗芯片,一个代理:Nvidia如何拆分推理、对话与管理任务

Nvidia的新技术栈将AI代理的工作流视为三项独立任务,而非单一任务。以Rubin GPU为核心的Vera Rubin NVL72机架负责处理代理任务所需的重载推理与检索步骤,而单独的Vera CPU机架则负责编排——跟踪工具调用并协调单个提示可能触发的上千步流程。继承自Nvidia对Groq收购的Groq 3 LPX机架则专用于生成环节:将推理结果转化为快速、可读的响应。Nvidia表示,完整的七芯片Vera Rubin平台现已进入全面生产,客户发货将于今年秋季启动[1]

这种专业化在基准测试中直接体现出来。在Gemma 4 31B模型、10万token上下文长度的测试中,Groq 3 LPX实现了每秒3,400个输出token的表现——在相同长上下文工作负载下,速度约为最接近替代平台的四倍[2]。这一数字作为原始速度记录的意义不如其传递的信号重要:Nvidia认为代理式AI真正需要的不是一颗通吃所有任务的芯片,而是一个将最慢、最直接影响用户体验的步骤交由专用硬件处理的流水线。

该策略不仅限于Nvidia自有芯片。NVLink Fusion向外部芯片制造商开放了相同的机架基础设施——包括NVLink组件、MGX机架设计、制造伙伴和集群软件——支持其开发定制XPUs和CPU,其中Intel贡献x86 CPU,三星电子代工厂则负责第三方硅片从设计到制造的全流程[3]。综合来看,这表明Nvidia希望即使对于非自身制造的硬件,也能掌控代理式AI工厂的底层架构。

一笔200亿美元却刻意避免被称为“收购”的交易

Nvidia对Groq的收购被广泛描述为一次收购——这是该公司有史以来最大的一笔交易,远超此前约70亿美元收购Mellanox的规模[4]。但该交易本身并未采用传统收购结构。它实际上是一笔许可协议,附带对Groq关键人员的聘用,而非正式合并,且Groq独立的云业务已被剥离并继续独立运营。Nvidia表示,与该交易相关的Groq机架将在年底前上线[5]

这种结构已引发真实质疑。社区讨论指出,许可加聘用的形式可能是规避标准200亿美元收购所必然引发的反垄断审查的一种可行方式,并注意到未被单独聘用的Groq员工未被纳入协议,而股东则是通过许可费获得补偿,而非标准的并购支付——尽管在同一讨论中也有观点直接反驳此说法,援引报道称股东仍获得了补偿。另一条讨论线索进一步指出,Groq的股权结构涉及政治关联投资者,并指控Nvidia刻意设计交易结构以规避当前政府的审查——这一说法目前仍属社区推测而非确认事实,但已影响外界对该交易的解读。

行业观察者认为这是一种熟悉的剧本:收购一家有前景的芯片初创公司,吸收其IP与人才,让独立硬件业务逐渐融入母公司的路线图——这正是Nvidia在收购Mellanox后被认为采取的模式。Groq的推理技术最终是主要作为Nvidia自身机架架构的内部升级,还是作为独立竞争者存续,这一开放性问题或许正是该交易非同寻常结构意在消解的核心。

从首个实验室部署到三个月内四个实际部署

区分芯片发布与真正产品的关键在于谁在实际运行它,而Vera Rubin的答案出人意料地迅速。CoreWeave于2026年6月1日完成了业内首个Vera Rubin NVL72在生产环境中的部署与验证,使用的是戴尔PowerEdge XE9812服务器及其自研液冷与机架控制工具[6]。Nebius紧随其后,承诺从2026年下半年起在其美国和欧洲数据中心部署Vera Rubin NVL72,并成为首家通过其Token Factory服务提供Groq 3 LPX的AI云服务商[7]

SpaceX与SpaceXAI正围绕Vera Rubin的机架级设计构建其AI基础设施——从地面数据中心到轨道计算,采用Vera CPU处理代理系统所需的编排、工具使用与模拟工作[2]。据客户对部署情况的描述,工程阶段的机架也已在微软数据中心内部运行,使市场三大最大云计算与算力买家在数周内相继采用同一新架构。

这种速度具有两面性。它确实反映了运营商对未经验证基础设施通常不会轻易投入生产的背景下,给予的真实信心投票。但对这些运营商而言,这也构成竞争风险:分析师警告称,SpaceX对Nvidia芯片的独家承诺可能会使CoreWeave和Nebius等新兴云厂商在GPU分配队列中进一步靠后,尽管两者均获得了Nvidia数十亿美元的股权投资,本应意味着优先获取权[8]

Nvidia不再只是卖芯片——它还在购买芯片之下的土地与电力

就在宣布Groq 3 LPX与Vera Rubin进入全面生产的同时,Nvidia披露了一项对Cloverleaf Infrastructure的少数股权投资——金额达数亿美元——这是一家已向数据中心运营商出售超过7吉瓦带电土地的地产开发商[9]。此举仅在几天前Nvidia对软银旗下电力子公司SB Energy进行约15亿美元股权投资之后,该投资与一处已租给OpenAI的俄亥俄州园区绑定[9]。另有一笔20亿美元对电力开发商Lancium的投资——其位于德克萨斯州阿比林的园区托管了Oracle基础设施,而OpenAI正在租赁——共同构成了Nvidia将资本直接投入电力与土地供应链,而不仅仅是置于其上的芯片的模式[10]

逻辑很清晰:Nvidia可以制造任意多的GPU,但如果无处插电,芯片就无法产生收入。对土地与电力开发商的股权投资,是一种确保数据中心容量能跟上芯片需求的方式,而非将这一瓶颈留给客户自行解决[11]

这也使Nvidia从单纯的供应商转变为市场的直接参与者。当同一家公司同时持有电力开发商、园区运营商和芯片本身的股权时,硬件供应商与基础设施运营商之间原本的独立关系开始模糊——目前尚不清楚这种集中化对争夺相同土地与电力资源的小型买家会产生何种影响。

尚未有任何Nvidia以外机构验证的10倍与35倍声明

Nvidia官方对比数据——代理吞吐量是Grace Blackwell的10倍,推理能效最高提升10倍——是Vera Rubin发布背后的核心宣传点[1]。华尔街基本接受了这一说法:Jefferies预计Vera Rubin收入将从2027财年第三季度约占Nvidia GPU收入的12%上升至第四季度的40%以上,机架出货量将从2026年底的约1.3万台增至2027年的逾12万台[12]

技术社区对此类整数倍数据则不那么信服。独立分析师指出,关于Groq集成后报告的35倍每兆瓦吞吐量数据仍需第三方验证才能采信,社区对“10倍”能效声明的讨论也公开称之为营销话术,有待独立确认。Nvidia在此方面记录参差——上一代GB300 NVL72曾预估性能为H100的约30倍,部署后据报道实际达到近100倍,这虽削弱了盲目怀疑的合理性,但并未完全消除疑虑。

开发者圈中另一个引发热议的相关问题:为何选择Groq而非Cerebras?流传的架构解释是,Groq的LPU以内存容量换取确定性的、由编译器调度的流水线,无停顿,且其多芯片机架设计比Cerebras的单一大晶圆芯片更顺畅地融入Nvidia现有的CUDA与NVLink生态——尽管讨论中也有人指出Cerebras仍更适合训练任务,意味着两者从一开始就并非完全可互换。

历史背景

Groq在2025年9月的一轮融资中估值达69亿美元,自2016年成立以来一直由投资者Disruptive支持。
Nvidia最终敲定了一项约200亿美元的Groq资产协议——这是该公司有史以来最大的交易,结构为并购式雇佣与非独家许可协议,而非正式收购,且Groq的云业务被排除在外并继续独立运营。
Nvidia此前最大收购为以色列芯片设计公司Mellanox,收购价接近70亿美元。
CoreWeave宣布完成业内首个NVIDIA Vera Rubin NVL72在生产环境中的部署与验证,使用戴尔硬件及其自研液冷与机架控制工具。
Nvidia宣布对Cloverleaf Infrastructure进行少数股权投资,几天前刚对SB Energy进行约15亿美元股权投资,该投资与一处租给OpenAI为期20年的俄亥俄州园区相关。
Nvidia宣布Groq 3 LPX与Vera Rubin同时进入全面生产,比其2027财年第二季度财报发布早两天。

关键关系图

关键玩家
主题

Nvidia的Vera Rubin与Groq推理建设推动代理式AI发展

NE

Nebius

First AI cloud to adopt Groq 3 LPX for its Token Factory service and one of the earliest to deploy Vera Rubin NVL72 across US and European data centers starting H2 2026, giving it an early pricing and availability edge over slower-moving clouds.

CO

CoreWeave

Ran the industry's first bring-up and validation of Vera Rubin NVL72 in production, positioning itself as Nvidia's reference deployment partner - though a $2 billion Nvidia equity stake hasn't stopped analysts from questioning its place in the chip allocation queue.

SP

SpaceX / SpaceXAI

Building its AI infrastructure - from Earth data centers to orbital satellites - specifically around Vera Rubin and Vera CPUs for agent orchestration, tool use, and simulation; its exclusive commitment to Nvidia chips is itself a competitive lever against other buyers.

CL

Cloverleaf Infrastructure

Received a minority equity investment worth several hundred million dollars from Nvidia to secure grid capacity for future data centers, having already sold more than 7 gigawatts of powered land - effectively becoming Nvidia's proxy in the land-and-power market.

SB

SB Energy

SoftBank's power subsidiary took a roughly $1.5 billion Nvidia equity stake tied to a 20-year Ohio campus already leased to OpenAI, tying Nvidia's capital directly to a rival cloud tenant's build-out.

LA

Lancium

Received a $2 billion Nvidia investment; its Abilene, Texas campus already hosts Oracle infrastructure that OpenAI rents, making Lancium another point where Nvidia's equity and OpenAI's compute footprint overlap.

事实来源

12 条引用
  1. [1] Vera Rubin Ramps to Full Production for the Agentic AI Factory
  2. [2] Vera Rubin, LPX, Spectrum-X and NVLink Fusion: Inside NVIDIA's Agentic AI Stack
  3. [3] NVIDIA NVLink Fusion
  4. [4] Nvidia Buying AI Chip Startup Groq for About $20 Billion, Its Biggest Deal Ever
  5. [5] Nvidia Says Groq Racks Will Be Online This Year After $20 Billion Deal
  6. [6] CoreWeave Completes Industry-First Bring-Up of NVIDIA Vera Rubin NVL72
  7. [7] Nebius to Offer NVIDIA Vera Rubin NVL72 in US and Europe From H2 2026
  8. [8] SpaceX-Nvidia Deal Raises Questions for Neoclouds CoreWeave and Nebius
  9. [9] Nvidia Partners With Data Center Developer Cloverleaf
  10. [10] Nvidia in Talks to Invest in Cloverleaf Infrastructure
  11. [11] Nvidia Backs Data Center Powered-Land Company Cloverleaf
  12. [12] Jefferies Drops Hot Nvidia Earnings Note

来源文章

Top 5

THE SIGNAL.

Analysts

将代理式AI视为一种根本性的全新工作负载类别,Vera Rubin的分离式设计正是为此类任务量身打造,单个提示现在可触发数千次推理与工具调用步骤。

Jensen Huang
CEO,NVIDIA

将Groq 3 LPX明确定位于推理的生成阶段——即决定代理式系统对用户响应速度的关键环节。

Danila Shtan
CTO,Nebius

强调生产级工程深度才是真正的差异化因素,认为实验室性能与生产性能的区别在于其背后的工程实现,而非基准幻灯片。

Chen Goldberg
产品与工程高级副总裁,CoreWeave

看好Vera Rubin的量产将显著提升Nvidia在F3Q27和F4Q27的GPU收入份额,预测2027年机架出货量将大幅增长。

Blayne Curtis
分析师,Jefferies

警告SpaceX对Nvidia芯片的独家承诺可能会使CoreWeave和Nebius等新兴云厂商在GPU分配队列中进一步靠后,尽管这两家公司也是Nvidia的股权投资对象,但仍构成竞争风险。

Bernstein analysts
华尔街分析师
The Crowd

SpaceX, in partnership with Nvidia, has designed a space-optimized Vera Rubin NVL72 system for launch to orbit in Q4 next year, with significant scale in 2028

@@elonmusk9238

Delivery day at our Microsoft DCs as the first production Vera Rubins arrive. A huge thank you to our partners at @nvidia and our Azure hardware and datacenter teams for all the incredible work that brought us to this milestone!

@@satyanadella8187

NEWS: NVIDIA Groq 3 LPX is now in full production. NVIDIA Vera Rubin NVL72 is the foundation of every AI factory. Paired with Groq 3 LPX, it unlocks faster, smarter agents and breakthrough user experiences. Through extreme co-design across seven chips and five purpose-built...

@@nvidianewsroom378

Nvidia's $20 billion Groq deal looks a lot like an acquisition in disguise

@u/AdSpecialist65982500
Broadcast
Deconstructing Nvidia's Vera Rubin — The Successor To Blackwell That's 10x More Efficient

Deconstructing Nvidia's Vera Rubin — The Successor To Blackwell That's 10x More Efficient

NVIDIA Vera Rubin Platform Ramping into Full Production | Built for the Era of Agents

NVIDIA Vera Rubin Platform Ramping into Full Production | Built for the Era of Agents

Did NVIDIA Just Kill The Inference Chip Market?

Did NVIDIA Just Kill The Inference Chip Market?