深度求索与华为昇腾芯片软件合作挑战英伟达CUDA
TECH

深度求索与华为昇腾芯片软件合作挑战英伟达CUDA

22+
Signals

战略概览

  • 01.
    深度求索为华为昇腾AI芯片开源了六个组件的软件栈——TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA和DeepSelect,覆盖矩阵运算、分布式通信、注意力处理和Top-K选择。
  • 02.
    深度求索与华为联合构建了一个连接128块昇腾950芯片的“超级节点”系统,经过调优以在集群中平衡计算与数据传输。
  • 03.
    深度求索的V4模型(1.6万亿参数)在发布时即获得华为昇腾950PR/950DT芯片的“零日支持”,同时寒武纪和海光也完成了零日适配。
  • 04.
    据报道,深度求索计划在内蒙古的一座数据中心部署超过16万台华为昇腾加速器,以降低其模型服务对英伟达硬件的依赖。

深度分析

六项工具,一个目标:在昇腾芯片上重塑CUDA的开发者体验

此次发布的并非单一工具,而是六项:TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA和DeepSelect,覆盖华为昇腾NPU的矩阵运算、分布式通信、注意力处理和Top-K选择 [1]。核心是TileLang,它被明确宣传为编写“内核”(即直接在芯片硬件上运行的性能关键小程序)的更简单方式,无需像传统CUDA那样要求深厚的硬件专业知识 [2]。深度求索自身的表述非常明确:“要构建新一代自主可控的GPU软件生态,首要任务是建立一种通用、易于编程且仍能充分发挥硬件性能潜力的高级语言。” 在性能方面,行业报道援引GitHub数据显示,FlashMLA在某些流程中达到了昇腾950理论性能的约95% [3]——这是一个显著的效率声明,尽管它衡量的是软件优化程度,而非与英伟达最新芯片的直接对比。该工具包还支撑了深度求索与华为联合设计的128芯片昇腾950“超级节点”,该系统经过双方共同调优,以在集群中平衡计算与数据流动 [4]。

为何开源胜于私藏:攻击CUDA的开发者锁定效应

此处更具战略意义的选择,并非深度求索为昇腾芯片做了优化,而是该公司免费开放了这些工具。据估计,英伟达的CUDA平台在全球拥有约四百万开发者,这种锁定效应建立在使用习惯、调试工具、文档和多年积累的代码之上,而不仅仅是硬件性能本身 [2]。一个封闭的专有工具包只能服务于深度求索自身的负载;而一个开源工具包则邀请所有因芯片出口限制而受困的开发者,开始在昇腾而非CUDA上培养使用习惯。这几乎就是英伟达当年让CUDA变得不可或缺所用的同一套策略,如今却被反向用于攻击英伟达自身。在YouTube上,一段广受关注的技术解析视频明确将此举视为对英伟达的“两线攻击”——将华为的硬件与深度求索的软件信誉结合——同时也提醒,新工具链的价值只有在开发者真正采用后才成立,而非发布当天。X平台上的反应则更直接地对挑战CUDA表示兴奋,未提及采用率这一前提。

出口管制的再定义:代码背后的地缘政治

这一动向的背景是美国对向中国销售先进英伟达芯片的限制。深度求索创始人曾表示,芯片出货禁令而非融资问题,才是公司发展的核心制约因素,这解释了其转向华为国产硬件与软件栈的原因 [5]。战略与国际研究中心(CSIS)的分析明确指出:如果深度求索将其绕过CUDA的优化技术用于增强华为昇腾芯片及CANN软件生态,“这将对英伟达构成远比其模型发布本身严重得多的威胁” [5]。这一警告已传达到英伟达高层——CEO黄仁勋公开表示,深度求索选择为华为昇腾芯片而非美国硬件优化,将是“对美国而言的可怕结果”,并认为如果人工智能在全球范围内基于中国技术栈扩散,中国可能在该领域超越美国 [6]。CSIS早前的研究已记录,尽管受出口管制,华为上一代昇腾910C的推理性能仍达到英伟达H100的约60%——这正是此次新一代950系列合作试图超越的基准 [5]。

规模验证:从V4模型零日支持到16万台芯片部署

这一进程并非始于9月的工具包发布。今年4月,深度求索的V4模型——一个1.6万亿参数的专家混合模型——在发布时即获得华为昇腾950PR和950DT芯片的“零日适配”支持,模型发布数小时后即通过直播宣布,同时中国芯片厂商寒武纪和海光也完成了各自的零日适配 [7]。这一基础正在扩大规模:据报道,深度求索计划在内蒙古的数据中心部署超过16万台华为昇腾加速器,而华为自身似乎也在为此准备硬件 [8]。该公司的发展轨迹标志着真实转变——深度求索最初严重依赖英伟达处理器,尤其是H800,之后逐渐转向国产替代方案 [9]。据路透社报道,深度求索已公开确认使用基于华为昇腾芯片的开源工具 [10]。

质疑之声:推理里程碑,而非已证实的训练突破

并非所有反应都持庆祝态度。社区讨论强烈质疑深度求索是否已将其全部训练负载迁移至昇腾硬件,指出早前有报道称一次在华为硬件上的深度求索训练运行失败,不得不回退至英伟达进行预训练——这意味着昇腾至今的角色主要集中于推理服务,而非要求更高的训练阶段。这一争议时间线已在公开场合显现:一条广泛传播的X平台帖子声称,深度求索的下一代模型V5将是首个完全在昇腾芯片而非英伟达上训练的模型——尽管尚无官方声明证实此传闻,但它表明训练与推理的界限仍不明朗。这一区别至关重要:CSIS自身的表述是有条件的——其关于“对英伟达构成更大威胁”的警告,描述的是深度求索若将其优化技术全面投入昇腾与CANN生态的后果,而非声称其已实现这一目标 [5]。技术评审者也提出了类似保留意见:所谓99%的“硬件利用率”仅衡量软件对昇腾自身性能上限的利用效率,而该上限与英伟达最新芯片的对比是另一回事——CUDA真正的护城河,与其说是峰值吞吐量,不如说是数十年积累的调试器、性能分析工具和文档,这些并非一个新开源、API兼容的工具包一经存在就能一夜之间抹除的。客观来看,实际情况介于两者之间:在软件和推理基础设施方面取得了真实、实质性的进展,但尚未确认在训练规模上完全替代英伟达。

历史背景

CSIS的分析记录了华为昇腾910C在受美国出口管制的情况下,仍实现英伟达H100约60%的推理性能,为后续深度求索与华为的软件合作提供了背景框架。
TileLang-Ascend首次开源,为开发者提供了在华为处理器上编写高性能工作负载的初始领域专用语言,早于2026年9月更全面的六组件工具包发布。
深度求索V4,一个1.6万亿参数的专家混合模型,在发布时即获得华为昇腾950PR/950DT芯片的“零日支持”,模型发布数小时后通过直播宣布;寒武纪与海光芯片也完成了零日适配。
深度求索宣布开源六组件昇腾软件栈(TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect),并披露了128芯片昇腾950超级节点合作及部署超16万台加速器的计划。

关键关系图

关键玩家
主题

深度求索与华为昇腾芯片软件合作挑战英伟达CUDA

事实来源

10 条引用
  1. [1] DeepSeek Open-Sources Six-Part Ascend Software Stack
  2. [2] DeepSeek and Huawei Open-Source TileLang to Challenge Nvidia's CUDA
  3. [3] DeepSeek Open-Sources Infrastructure Components for Huawei Ascend Platform
  4. [4] DeepSeek's New Tools Pit Huawei Against Nvidia's CUDA
  5. [5] DeepSeek, Huawei, Export Controls, and the Future of the US-China AI Race
  6. [6] Nvidia's Jensen Huang Warns DeepSeek-on-Huawei Would Be a 'Horrible Outcome' for the US
  7. [7] Huawei Ascend, Cambricon, and Hygon Complete Day-0 Adaptation to DeepSeek V4
  8. [8] Huawei Prepares 160,000 Ascend 950DT Accelerators for DeepSeek Data Center
  9. [9] DeepSeek, Huawei Partner on Ascend AI Chip Programming Tools
  10. [10] China's DeepSeek Says It Used Open-Source Tools Based on Huawei Ascend Chips

来源文章

Top 5

THE SIGNAL.

Analysts

“表示深度求索为华为昇腾芯片而非美国硬件优化AI模型,将是美国的重大战略挫折,若未来人工智能在全球扩散时基于不同的技术栈,中国可能在人工智能领域超越美国。”

Jensen Huang, CEO, Nvidia
Warns against the shift to Huawei hardware

“认为,若深度求索将其绕过CUDA的优化技术用于增强华为昇腾芯片及CANN软件生态,其对英伟达的威胁将远超其模型发布本身。”

CSIS (Gregory C. Allen)
Export controls are slowing but not stopping China's AI chip progress

“表示华为昇腾芯片是中国对英伟达的最佳国产替代方案,而V4模型的零日支持表明顶级中国AI模型现已可在国产硬件上运行。”

He Hui, Director of Semiconductor Research, Omdia
Independent industry analyst
The Crowd

“‼️ BREAKING: DeepSeek is building software for Huawei's AI chips to break its dependence on Nvidia, open-sourcing six core tools that take direct aim at CUDA. Huawei backed the project, which adapts TileLang, a coding language DeepSeek calls simpler than Nvidia's CUDA, for”

@@IntCyberDigest2604

“🚨 DeepSeek V5 Leak: Beats Astra >DeepSeek is reportedly preparing an imminent V5 launch >Founder Liang Wenfeng calls it the company's biggest bet yet >Rumored at 2 trillion parameters (not 3T) >Reportedly the first DeepSeek model to train fully on Huawei Ascend chips instead of”

@@Priyannkaaaa4572

“DeepSeek is preparing developers to move from NVIDIA to Huawei Ascend hardware. It released free, open-source software that lets developers keep familiar ways of working with NVIDIA but on Huawei hardware. Im thinking if this is their way to pave the way for a DGX Spark like”

@@plotarmordev216

“DeepSeek to order 160000 Huawei AI chips over Nvidia”

@u/CleaRSightZ594
Broadcast
DeepSeek Just Gave Huawei What Nvidia Fears Most.

DeepSeek Just Gave Huawei What Nvidia Fears Most.

DeepSeek + Huawei Just Went After Nvidia's CUDA Moat

DeepSeek + Huawei Just Went After Nvidia's CUDA Moat

Ep. 017 - DeepSeek V4 and Huawei Ascend NPU Performance (InferenceX)

Ep. 017 - DeepSeek V4 and Huawei Ascend NPU Performance (InferenceX)