AWS 与 NVIDIA 的 200 万 GPU AI 基础设施扩展
TECH

AWS 与 NVIDIA 的 200 万 GPU AI 基础设施扩展

26+
Signals

战略概览

  • 01.
    AWS 与 NVIDIA 正在扩大合作,计划于 2027 至 2028 年间在其全球基础设施中部署额外 200 万个 GPU——包括 Blackwell Ultra、Rubin 和 Rubin Ultra。
  • 02.
    这项新承诺建立在之前一项从 2026 年开始部署超过 100 万个 GPU 的协议基础上,亚马逊表示,该部署窗口尚未关闭时,需求已超出预期。
  • 03.
    NVIDIA 与亚马逊的 Annapurna Labs 联合开发的新型 NVHBM 内存技术及其 NVLink Fusion 互连技术,正被集成到 AWS 下一代 Trainium4 芯片中。
  • 04.
    此外,亚马逊将其对 NVIDIA 芯片的总体订单量增至约 300 万颗,据估计这笔交易价值数百亿美元。

深度分析

每颗新 AWS 芯片内部隐藏的内存技术

NVIDIA 此次真正的技术贡献并不仅仅是更多 GPU——而是对内存工作方式的重新设计。NVHBM 将内存控制器完全从计算芯片中移出,转移到 HBM 内存堆栈的基底芯片中,从而在处理器上腾出更多硅片面积用于计算逻辑,同时提升内存带宽并降低功耗[1]。NVIDIA 表示,与标准 HBM4E 相比,该技术可实现高达 30% 的内存带宽提升、15% 的 HBM 功耗降低,以及最多 25% 的可用计算芯片面积增加[1]。亚马逊的芯片设计部门 Annapurna Labs 是首个与 NVIDIA 合作开发该技术的外部合作伙伴——值得注意的是,Annapurna 正是设计 AWS 自研 Trainium 处理器的团队。

这种重叠正是关键所在。对于 Trainium4,NVHBM 技术与 NVLink Fusion 互连技术并行部署,后者是 AWS 在 re:Invent 2025 上首次公布的[2]。NVLink Fusion 芯粒可将最多 72 颗定制 ASIC 以每颗 3.6 TB/s 的速度实现全互连,通过基于下一代 NVLink 6 的 Vera-Rubin NVLink 交换托盘,实现高达 260 TB/s 的总扩展带宽[2],其速度约为 PCIe Gen5 的 28 倍[3]。实际上,AWS 的自研芯片与 NVIDIA 的 GPU 正被接入同一物理架构,而非作为争夺机架插槽的独立产品线相互竞争。

AWS 刚刚承认 Trainium 并非旨在取代 NVIDIA

AWS 今年的公开言论直接否定了 Trainium 旨在取代 NVIDIA 的说法。在彭博电视的一次采访中,AWS 首席执行官 Matt Garman 表示,NVIDIA “拥有出色的产品”,并称“未来很长一段时间内,绝大多数工作负载将继续在 NVIDIA 处理器上运行”——这番表态令人意外,因为 AWS 正投入数十亿美元开发竞争性芯片产品线。ConvergeDigest 对新互连技术的分析也支持这一观点:随着 NVLink Fusion 和 NVHBM 被集成到 Trainium4 中,Trainium 与 NVIDIA GPU 在 AWS 系统中的关系“已不再是客户工作负载决策中的竞争替代方案,而是正在硅片层面融合为单一架构”[3]

这种定位彻底改变了这笔交易的本质。与其说是 AWS 在对冲对 NVIDIA 的依赖,不如说该合作旨在让客户无需做出选择——Trainium 与 NVIDIA GPU 越来越多地接入同一 NVLink 架构,共享相同的机架设计,并作为互补资源进行配置,而非替代选项。

一项尚未启动便已失效的百万 GPU 订单

若仅关注 GPU 数量,这一逆转的规模很容易被忽视。AWS 之前的承诺——从 2026 年起部署超过 100 万个 GPU——是在 NVIDIA 的 GTC 2026 大会上宣布的,但据报道,该订单在其部署窗口关闭前就已耗尽[4],亚马逊仅表示“需求已超出预期”[5]。五个月后,AWS 与 NVIDIA 再次宣布,将在 2027 至 2028 年间于其全球基础设施中部署额外 200 万个 Blackwell Ultra、Rubin 和 Rubin Ultra GPU[6]

这并非孤立事件。此外,亚马逊将其对 NVIDIA 芯片的总体订单量增至约 300 万颗,据行业估计,基于 GPU 单价,这笔交易价值“数百亿美元”,尽管双方未披露具体条款[7]。亚马逊的自研芯片业务年化收入已突破 250 亿美元,背后有来自 Anthropic 和 OpenAI 等 AI 实验室总计 2250 亿美元的承诺支持[7]。这些数字单独来看均体现激进的产能规划;叠加在一起,则描绘出一家企业不断为尚未能超越的需求曲线加码 AI 基础设施投资的图景。

华尔街的循环融资担忧

并非所有人都像 NVIDIA 和 AWS 在社交媒体上那样热情洋溢。当消息传至 Reddit 的股票与金融板块时,讨论迅速分化。在 r/stocks 和 r/wallstreetbets 中,一些评论者进行了自己的建模:200 万个 GPU 将为 NVIDIA 带来约 700 亿美元的前期收入,若 AWS 以典型云定价在五年内出租这些算力,则可产生超过 2000 亿美元的下游收入——这是对交易经济性的乐观解读。

但同一社区的其他讨论帖则公开表示怀疑,将该安排视为 AI 基础设施循环融资的症候,并类比此前企业时代的会计失败案例。评论者还指出,尽管消息重磅,亚马逊股价并未因此上涨,有帖子将其与 NVIDIA 与多家主要资产管理公司达成的数百亿美元计算融资安排联系起来——暗示 NVIDIA 正在多个层面同时为其芯片需求提供资金支持。值得注意的是,这种怀疑情绪集中在 r/stocks 和 r/wallstreetbets 等金融向子版块中,看涨收入模型与泡沫类比在同一讨论串中并存。

另外 10 万颗 GPU:为美国政府打造的机密 AI 工厂

在商业新闻背后,还有一项规模较小但意义不同的独立承诺:AWS 与 NVIDIA 将为美国政府构建 AI 工厂,包含 10 万颗 GPU,部署于符合影响等级 6(IL6)及以上安全要求的机密 AWS 基础设施中[5]。IL6 是美国政府用于最敏感工作负载的分类层级——此类环境不允许云提供商简单复用商业数据中心资源。

一项合作公告如今同时涵盖超大规模商业部署、机密政府 AI 工厂和标准化的定制芯片内存架构,这反映出 AI 基础设施采购已高度集中。IL6 及以上级别的政府工作负载通常要求比普通商业云更严格的安全边界——将 10 万颗 GPU 的专项承诺纳入同一公告,表明 AWS 与 NVIDIA 正将机密计算视为整体扩建的延伸,而非独立谈判的单独项目。

历史背景

AWS 在 2025 年 AWS re:Invent 大会上宣布其下一代 Trainium 芯片将支持 NVIDIA 的 NVLink Fusion 互连技术,这是 NVIDIA 首次与超大规模云厂商的自研芯片达成多代 NVLink Fusion 合作。
AWS 与 NVIDIA 在 NVIDIA GTC 2026 大会上宣布了从 2026 年起部署超过 100 万个 GPU 的先前承诺,比此次 200 万 GPU 扩展计划早约五个月。

关键关系图

关键玩家
主题

AWS 与 NVIDIA 的 200 万 GPU AI 基础设施扩展

AW

AWS (Amazon Web Services)

云基础设施提供商,负责部署 GPU 并通过 Annapurna Labs 将 NVLink Fusion 集成到其 Trainium 芯片系列中;通过设定自身产能承诺来主导扩建节奏。

NV

NVIDIA

提供 GPU、Vera CPU、NVLink Fusion 互连、NVHBM 内存及支撑扩展的网络技术;实质上定义了 AWS 自研芯片必须与之互操作的技术架构。

AM

Amazon's Annapurna Labs

亚马逊的芯片设计部门,首个与 NVIDIA 合作开发 NVHBM 的外部伙伴,同时设计 AWS 的竞争性 Trainium 处理器——使其能直接影响 AWS 芯片与 NVIDIA 硬件的融合程度。

U.

U.S. government

专用机密 AI 工厂(10 万颗 GPU,符合影响等级 6 及以上)的客户,将合作的影响延伸至国家安全基础设施领域。

AI

AI labs and enterprises (e.g., Anthropic, OpenAI)

其计算需求与承诺——作为支撑亚马逊自研芯片业务 2250 亿美元总承诺的一部分——是驱动 AWS 与 NVIDIA 产能决策的根本力量。

事实来源

7 条引用
  1. [1] NVIDIA NVLink Fusion Brings NVHBM to Next-Generation AI Infrastructure
  2. [2] AWS Integrates AI Infrastructure with NVIDIA NVLink Fusion for Trainium4 Deployment
  3. [3] AWS Links Trainium Strategy with NVIDIA NVLink, NVHBM and Vera
  4. [4] AWS Adds 2 Million More NVIDIA GPUs After Prior 1 Million Commitment Ran Out Early
  5. [5] Amazon and NVIDIA to Deliver 2 Million Additional GPUs and Next-Generation Infrastructure for Agentic and Physical AI
  6. [6] AWS and NVIDIA to Deliver 2 Million Additional GPUs and Next-Generation Infrastructure for Agentic and Physical AI
  7. [7] Amazon just tripled its order of Nvidia chips over 'surging demand'

来源文章

Top 5

THE SIGNAL.

Analysts

将此次扩展定位为围绕客户灵活性,而非在 AWS 与 NVIDIA 硬件之间强制选择:“客户希望有自由选择最适合其 AI 工作负载的工具,也希望确信所有组件都能无缝协同工作。”

Matt Garman
AWS 首席执行官

将该交易视为双方长达 16 年合作的下一阶段,扩展至 GPU、CPU、网络、开源模型和软件全栈:“如今,我们正在将合作扩展至全栈——GPU、CPU、网络、开源模型和软件——以空前的速度和规模实现智能体与物理 AI,这是只有 AWS 和 NVIDIA 才能实现的。”

Jensen Huang
NVIDIA 创始人兼首席执行官

将 NVHBM 定位为 AI 芯片内存设计的重要架构突破:“NVHBM 代表了一种提升高带宽内存性能与效率的新架构方法。”

Nafea Bshara
Annapurna Labs(亚马逊)副总裁
The Crowd

Announcing the expansion of NVIDIA NVLink Fusion with NVHBM, a next-generation high-bandwidth memory technology that brings higher memory performance and efficiency to XPUs. Amazon's @AnnapurnaLabs will be the first to work with us on NVHBM, combining @awscloud custom silicon...

@@NVIDIAAIInfra984

NVIDIA and @awscloud are expanding the partnership across the full stack — GPUs, CPUs, networking, open models and software — to make agentic and physical AI real at a pace and scale that only we can deliver together. What that looks like: 2 million additional NVIDIA GPUs...

@@nvidianewsroom816

AWS expanded its NVIDIA roadmap by 2M GPUs across Blackwell Ultra, Rubin and Rubin Ultra. The added Blackwell Ultra, Rubin and Rubin Ultra GPUs are scheduled for 2027-2028, on top of AWS's earlier 1M-plus plan. AWS announced that earlier batch in March for deployment starting...

@@rohanpaul_ai37

Amazon and NVIDIA to Deliver 2 Million Additional GPUs and Next-Generation Infrastructure for Agentic and Physical AI

@Not69Batman144
Broadcast
AWS CEO Talks New Chip Clusters, Nvidia and AI Ambitions

AWS CEO Talks New Chip Clusters, Nvidia and AI Ambitions

NVIDIA NVLink Fusion: Building Semi-Custom AI Infrastructure

NVIDIA NVLink Fusion: Building Semi-Custom AI Infrastructure

AWS and NVIDIA Expand 15+ Year Partnership

AWS 与 NVIDIA 的 200 万 GPU AI 基础设施扩展 — AI 新闻 | Agentic Brew