工具链解析:六款工具旨在复刻CUDA
2026年9月30日发布的并非单一工具,而是一整套堆栈:TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA和DeepSelect,每项均已移植至华为昇腾芯片上运行[1]。值得注意的是,这六项组件与深度求索此前为英伟达GPU开源的组件一一对应,意味着该公司并非从零开始编写新工具,而是将其面向英伟达的完整训练堆栈重建于第二个硬件平台[3]。其中核心是TileLang,它被宣传为一种更简单的高级编程语言,使开发者无需直接操作昇腾底层指令集即可编写AI内核[4]。深度求索与华为在软件发布的同时达成了一项硬件里程碑:基于昇腾950芯片联合构建的128芯片超级节点,目前深度求索自身模型训练中使用的所有TileLang算子均已具备高性能的昇腾实现版本[5]。早期基准测试表明,该抽象层并未显著牺牲性能——TileLang-昇腾的GEMM工作负载运行效率约为手写昇腾C代码的0.98倍,向量算子约为0.96倍,立方-向量工作负载约为0.95倍[2]。深度求索明确以意识形态角度阐述此次努力,指出构建独立、自主可控的GPU软件生态系统的起点,正是一种通用、易于编程且能充分释放硬件潜力的高级语言[5]。
/dq/media/media_files/2026/09/30/deepseek-x-huawei-2026-09-30-17-31-38.png)


