深度求索联合华为开源昇腾AI芯片工具链
TECH

深度求索联合华为开源昇腾AI芯片工具链

22+
Signals

战略概览

  • 01.
    2026年9月30日,深度求索在华为的支持下,开源了六项专为华为昇腾AI芯片定制的软件组件:TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA和DeepSelect。
  • 02.
    这六项已发布的组件与深度求索此前为英伟达平台开源的工具一一对应,实质上是将其训练堆栈移植到了第二个硬件生态系统。
  • 03.
    TileLang被定位为一种更简单的高级编程语言,可作为编写AI内核的CUDA替代方案。
  • 04.
    深度求索与华为联合构建了基于昇腾950芯片的128芯片超级节点解决方案,目前深度求索模型训练中使用的每个TileLang算子,均已在昇腾平台上实现了对应的高性能版本。
  • 05.
    TileLang-昇腾的基准测试显示,GEMM工作负载性能约为手写昇腾C代码的0.98倍,向量算子约为0.96倍,立方-向量工作负载约为0.95倍。
  • 06.
    深度求索将此次发布定位为构建一个独立、自主可控的GPU软件生态系统的必要步骤,强调需要一种通用、易于编程的高级语言。

深度分析

工具链解析:六款工具旨在复刻CUDA

2026年9月30日发布的并非单一工具,而是一整套堆栈:TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA和DeepSelect,每项均已移植至华为昇腾芯片上运行[1]。值得注意的是,这六项组件与深度求索此前为英伟达GPU开源的组件一一对应,意味着该公司并非从零开始编写新工具,而是将其面向英伟达的完整训练堆栈重建于第二个硬件平台[3]。其中核心是TileLang,它被宣传为一种更简单的高级编程语言,使开发者无需直接操作昇腾底层指令集即可编写AI内核[4]。深度求索与华为在软件发布的同时达成了一项硬件里程碑:基于昇腾950芯片联合构建的128芯片超级节点,目前深度求索自身模型训练中使用的所有TileLang算子均已具备高性能的昇腾实现版本[5]。早期基准测试表明,该抽象层并未显著牺牲性能——TileLang-昇腾的GEMM工作负载运行效率约为手写昇腾C代码的0.98倍,向量算子约为0.96倍,立方-向量工作负载约为0.95倍[2]。深度求索明确以意识形态角度阐述此次努力,指出构建独立、自主可控的GPU软件生态系统的起点,正是一种通用、易于编程且能充分释放硬件潜力的高级语言[5]。

为何此时发布:出口管制与中国自主可控战略

此次发布是分阶段推进的第四步,并非突然之举。深度求索最早于2025年2月的“开源周”期间开源了五项面向英伟达的工具,随后于2025年9月推出TileLang-昇腾版本,2026年4月发布针对昇腾平台的深度求索V4内核,最终在当前完成六组件完整工具链的开源[2][8][9]。这一脉络背后是北京推动AI芯片实现“自主可控”的战略,因为美国出口管制持续限制了外国AI芯片对中国企业的性能与供应量[7]。该工具链的关键设计目标是降低迁移成本:例如TileKernels提供了通用API和硬件抽象层,使开发者能在英伟达与昇腾之间迁移工作负载时减少代码重写,从而降低采用国产芯片的工程成本[1]。从这个角度看,此次发布更像是一种为应对日益收紧的芯片管制而专门构建的基础设施,而非一次性的开源行为。

质疑之声:一门语言不等于一个生态系统

并非所有人都认为这能撼动CUDA。有报道援引一位分析师观点指出,更简单的编程模型本身并不足以使TileLang成为比CUDA更广泛的生态系统替代品,因为英伟达的优势不仅在于语法,更在于多年积累的库、开发工具、优化工作以及开发者熟悉度[4]。已公布的基准测试结果——TileLang-昇腾达到手写昇腾C代码性能的0.95至0.98倍——仅衡量了单个内核性能,尚未揭示该工具链在生产规模和成本效益下的整体表现[2]。历史采用数据也增加了谨慎态度——据报道,2024年中国企业采购了约100万颗英伟达H20芯片,而华为昇腾910B芯片出货量估计仅为45万颗,这一差距表明,即便软件桥梁已存在,英伟达在中国开发者中的实际吸引力并未消失[6]。

次级影响:对中国芯片需求的连锁反应

该工具链的发布似乎正在改变实际采购行为。在深度求索持续推动昇腾平台后,据报道,字节跳动、腾讯和阿里巴巴已向华为接洽关于昇腾950芯片的新订单,而华为计划在2026年生产约75万台昇腾950PR芯片,大规模生产将于4月启动,下半年实现全面出货[6]。这一需求信号在某种程度上比代码本身更重要:开源工具链的价值取决于市场上是否有足够多的昇腾芯片可供运行,而华为的硬件供应历来是制约因素,而非深度求索编写软件的意愿。

历史背景

深度求索在2025年2月的开源周期间发布了五项为英伟达GPU构建的工具,这些工具正是后来移植到昇腾平台的组件的直接前身。
TileLang-昇腾首次开源,为开发者提供了在华为处理器上实现高性能工作负载的领域专用语言,早于2026年9月更完整的工具链发布。
深度求索在完整六组件工具链开源之前,率先发布了针对昇腾平台的深度求索V4内核。
深度求索开源了完整的六组件昇腾工具链,同时华为详细介绍了双方共同定义的SuperPoD Flex系统。

关键关系图

关键玩家
主题

深度求索联合华为开源昇腾AI芯片工具链

DE

DeepSeek

中国AI实验室,开发并开源了该工具链(TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect),将其面向英伟达的训练基础设施移植到华为昇腾硬件上,降低自身模型训练对CUDA的依赖。

HU

Huawei

提供了昇腾AI芯片硬件(包括昇腾950系列)及工程支持,用于联合构建128卡超级节点解决方案,将昇腾定位为中国AI开发者替代英伟达GPU的本土选择。

NV

Nvidia

现有市场主导者,其CUDA软件护城河和中国GPU市场份额直接受到此次发布的挑战;其软件优势不仅在于编程语言,更在于多年积累的库、工具和开发者熟悉度,这是TileLang单独无法复制的。

BY

ByteDance, Tencent, and Alibaba

据报道在深度求索发布与昇腾相关的成果后,已向华为接洽关于昇腾950 AI芯片的新订单,表明中国更广泛的产业界对国产芯片存在需求。

事实来源

9 条引用
  1. [1] DeepSeek Opened the Code. Can Huawei Deliver the Compute?
  2. [2] DeepSeek Expands Huawei Ascend Push With Six Open-Source AI Tools
  3. [3] DeepSeek Ascend Tools Mirror Nvidia-Based Predecessors, Huawei Confirms
  4. [4] DeepSeek Targets Nvidia's Software Moat With Huawei Partnership
  5. [5] DeepSeek Builds for Huawei Ascend
  6. [6] DeepSeek's Huawei-Optimized Model Signals That U.S. Chip Controls May Be Losing Their Bite
  7. [7] China's Drive Toward Self-Reliance in Artificial Intelligence Chips and Large Language Models
  8. [8] TileLang: DeepSeek, Huawei, Ascend, and the Push Beyond CUDA
  9. [9] DeepSeek, Huawei Open-Source Ascend Chip Tools

来源文章

Top 4

THE SIGNAL.

Analysts

“更简单的编程模型本身并不足以使TileLang成为比CUDA更广泛的生态系统替代品,因为英伟达的软件优势不仅在于编程模型,更在于多年积累的库、开发工具、优化、框架以及开发者熟悉度。”

Unnamed industry analyst
通过Gurufocus发表的市场评论
The Crowd

“DeepSeek and Huawei are building an alternative to Nvidia’s CUDA as China ramps up its domestic AI chip industry. Via Bloomberg: DeepSeek has released an open-source toolkit for Huawei’s Ascend accelerators, including TileLang support optimized for Ascend 950. The tools...”

@@kimmonismus738

“DeepSeek-V3.2 shows: - Chinese chips are rising: Day-0 support for Huawei Ascend & Cambricon; - ML compiler: DeepSeek uses TileLang, letting you write Python → compile to optimized kernels on diverse hardware. E.g., 80 lines of Python can reach 95% of FlashMLA’s (CUDA written...”

@@Yuchenj_UW1325

“DeepSeek has open-sourced its AI infrastructure stack for Huawei Ascend NPUs. The release brings several components to Ascend, corresponding to DeepSeek's existing NVIDIA GPU stack: • TileLang — a high-level DSL for writing optimized AI kernels • DeepGEMM-Ascend — optimized...”

@@Chinazhidx204

“DeepSeek to order 160000 Huawei AI chips over Nvidia”

@u/CleaRSightZ593
Broadcast
Ep. 017 - DeepSeek V4 and Huawei Ascend NPU Performance (InferenceX)

Ep. 017 - DeepSeek V4 and Huawei Ascend NPU Performance (InferenceX)

Breaking the CUDA Moat: How DeepSeek TileLang is Ending NVIDIA Lock-In

Breaking the CUDA Moat: How DeepSeek TileLang is Ending NVIDIA Lock-In

The Hidden Engine Behind DeepSeek V4 - DeepEP V2 and TileKernels Explained

The Hidden Engine Behind DeepSeek V4 - DeepEP V2 and TileKernels Explained