← 全部文章

人工智能

深度求索为华为昇腾开源了六个库。出口管制从来没有碰过的,正是这一层软件

深度求索(DeepSeek)9 月 30 日发布了面向华为昇腾 950 的 TileLang 后端,以及五个算子与通信库,与华为联合开发,并已上游合并进语言主干、与 CUDA 后端并列。出口政策卡住了芯片,却从未卡住 CUDA——而真正难替换的,一直都是 CUDA。

MAI
deepseek-ai/DeepGEMM-Ascend 仓库的 GitHub 社交卡片,显示项目名称及其「面向华为昇腾 NPU 的矩阵乘算子库」的描述。

深度求索(DeepSeek)9 月 30 日发布了六个面向华为昇腾(Ascend)AI 加速器的开源软件组件,与华为联合开发,并在公司自己的微信公众号上宣布。其中的主角是 TileLang——一种用来编写计算算子(kernel)的语言——现在有了官方的昇腾 950 后端。另外五个是算子库和通信库,几乎与深度求索此前为英伟达 GPU 发布的那一套一一对应。

这种对应关系就是全部要点。这不是一次模型发布,而是深度求索在宣布:它训练自家前沿模型所用的那套工具链,如今把国产芯片当作一等目标来对待。

发布了什么

组件作用
TileLang(昇腾 950 后端)面向昇腾的算子编写语言,具备原生代码生成、自动调度与同步
DeepGEMM-Ascend矩阵乘算子
TileKernels向量计算与内存算子
FlashMLA面向长上下文推理的稀疏注意力
DeepEP跨设备的专家并行通信
DeepSelect高效数据筛选

昇腾 950 后端以 3308 号拉取请求(pull request)上游合并进了 tile-ai/tilelang 项目,9 月 29 日合入,134 个提交,署名贡献者为 SiriusNEO 与 LeiWang1999。这个细节比看上去更重。这不是一个停在互联网角落里的厂商分支,而是落进了语言主干分支,就在 CUDA 后端旁边;而且它没有借用 CUDA 的线程模型,而是为算子启动定义了自己的方言。

这个后端暴露出来的,是昇腾这台机器本来的样子。算子可以在一个 kernel 内组合 AIC 单元上的 Cube 矩阵运算与 AIV 单元上的 Vector 运算;内存可以在 UB、L1、L0 各层级上显式放置;块缩放的 MXFP8 与 MXFP4 运算各有自己的路径。一个 AutoSchedule 流程负责考虑依赖关系的指令流水、多缓冲,以及核内与跨核同步屏障的插入。设备侧代码经由华为 CANN 工具包中的毕昇(bisheng)编译器编译,张量与流可与 PyTorch 的 NPU 后端互操作。深度求索与华为还描述了一个把 128 颗昇腾 950 连起来的超节点配置,在计算与通信两侧一并优化。

性能方面的说法都是深度求索自己的,发布在 DeepGEMM-Ascend 仓库里,而非经外部验证。README 报告稠密矩阵乘最高达到硬件上限的 99.8%,FP8 推理最高 861 TFLOPS,MegaMoE 运算最高 846.3 TFLOPS,MQA logits 以 99% 的利用率把 FIX 流水打满——全部是在搭配 CANN 9.20 的昇腾 950 系列上取得的。在有人复现之前,这些应当被当作厂商自报数据看待。那个拉取请求里的评测更克制,也更有用:bfloat16 矩阵乘与 PyTorch 现有 NPU 路径持平或更好,FP8 类型转换接近带宽上限。

从未落下的那道管制

美国的出口政策花了三年限制芯片的销售,却从未限制 CUDA——而更难替换的正是 CUDA。英伟达的优势不只在于它的加速器快,而在于二十年积累的算子、库、框架集成,以及工程师的肌肉记忆,都以它的编程模型为前提。一家中国实验室即便拿到一仓库昇腾器件,仍然要面对一个问题:它想跑的软件是为别的东西写的。

这次发布要填的就是这道缝,而且是从唯一能填的位置去填。华为开源 CANN、把它接进 PyTorch、Triton 和 vLLM,已经做了一段时间;但芯片厂商自己写工具链,说到底是厂商在推销。深度求索来写,则是这个国家最有能力的模型实验室为这套工具背书:它足以支撑前沿训练。按公司的说法,其 V4 系列训练中用到的每一个 TileLang 算子,现在都有了高性能的昇腾实现。深度求索早在 4 月就把 V4 移植到了华为硬件上。据报道,它正在内蒙古建设一座容纳约 16 万颗昇腾加速器的数据中心。今天发布的这些库,正是让那个数字变得有意义的东西。

这不是什么

六个库加一个编译器后端,不等于 CUDA。这个后端瞄准的是昇腾 950;更早的 A2 与 A3 仍由另一个社区项目支撑。PTO 代码生成路径与虚拟机内建指令在上游化过程中被去掉了。这些算子覆盖的是深度求索自身负载所需的部分——注意力、矩阵乘、专家混合模型的通信、数据筛选——这是一个狭窄但挑得极准的切面,而不是通用生态。模型长得和深度求索不一样的人,基本还得自己想办法。

但值得注意的是方向。芯片终究是会到位的:良率会提升,设计会迭代,库存会堆起来。软件层才是那个看起来需要十年耐心、不出彩、而且没什么人有动力去做的部分。深度求索有动力,有工程师,而且正在用宽松许可证公开地做这件事——中国境内境外的任何人都可以直接拿去用。出口管制可以拦下一批货,却没法把一个已经合并的拉取请求撤回去。

Sources: Bloomberg: DeepSeek Unveils Huawei AI Chip Tools That May Replace Nvidia's, South China Morning Post: China's DeepSeek open-sources tools to help Huawei chips supplant Nvidia in AI, deepseek-ai/DeepGEMM-Ascend on GitHub, tile-ai/tilelang pull request #3308: Introduce Ascend 950 backend, tile-ai/tilelang-ascend on GitHub

继续阅读