六项工具,一个目标:在昇腾芯片上重塑CUDA的开发者体验
此次发布的并非单一工具,而是六项:TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA和DeepSelect,覆盖华为昇腾NPU的矩阵运算、分布式通信、注意力处理和Top-K选择 [1]。核心是TileLang,它被明确宣传为编写“内核”(即直接在芯片硬件上运行的性能关键小程序)的更简单方式,无需像传统CUDA那样要求深厚的硬件专业知识 [2]。深度求索自身的表述非常明确:“要构建新一代自主可控的GPU软件生态,首要任务是建立一种通用、易于编程且仍能充分发挥硬件性能潜力的高级语言。” 在性能方面,行业报道援引GitHub数据显示,FlashMLA在某些流程中达到了昇腾950理论性能的约95% [3]——这是一个显著的效率声明,尽管它衡量的是软件优化程度,而非与英伟达最新芯片的直接对比。该工具包还支撑了深度求索与华为联合设计的128芯片昇腾950“超级节点”,该系统经过双方共同调优,以在集群中平衡计算与数据流动 [4]。



