在 128 颗昇腾 950 组成的超节点上,把每颗芯片的算力榨干,同时让芯片之间的数据传得足够快——这两个决定大模型能否真正跑起来的关键环节,DeepSeek 和华为现在把优化代码全部公开了。

据路透社 9 月 30 日报道,DeepSeek 发布了一批与华为联合开发、面向昇腾 AI 芯片的开源编程工具,开发过程中华为提供了全程支持。这批工具既包括 AI 计算库和芯片间通信库,也包含高层编程语言 TileLang 对昇腾的原生支持。

计算与通信:两块最难啃的骨头

在多加速器上跑大模型,本质上要同时满足两个条件:每颗芯片高效完成计算,以及芯片之间的数据搬运快到足以让处理器不空转。这次发布的两个库恰好一一对应,而且都在昇腾 950 硬件上完成开发与测试。

DeepGEMM-Ascend 负责矩阵乘法等 DeepSeek 模型中的核心计算,支持 BF16、FP8、FP4 三种精度格式。它沿用了 DeepSeek 既有 DeepGEMM 库的同一套编程接口,开发者迁移到昇腾时不必重学 API。

DeepEP-Ascend 负责训练和推理过程中的通信,包括把数据路由到混合专家(MoE)模型的不同专家,再将其输出汇总回来。简单说,前者解决“算得快”,后者解决“传得动”。

TileLang 补上昇腾 950 原生支持

TileLang 提供的是编写优化算子所需的高层编程层。DeepSeek 形容它相比英伟达 CUDA 提供了“更简单的编程模型”,目标直指开发效率和代码简化。这门语言此前已支持英伟达等硬件,也早有面向昇腾处理器的适配器;9 月 30 日的更新补上了对昇腾 950 的原生支持,涵盖代码生成、自动调度与同步。

值得注意的是,TileLang 的多平台特性并未被放弃——它依然对英伟达 GPU 可用。换句话说,这套工具是给开发者多开一条路,而不是把原有的门焊死。

软件栈才是芯片能不能卖出去的关键

芯片的算力参数再亮眼,如果开发者写不出高效算子、跑不通分布式训练,硬件就只是参数表上的数字。围绕 CUDA 建立的库、编译器与十几年调优经验,正是英伟达最难被复制的部分。DeepSeek 这次把自家模型生产中真正用到的计算库和通信库开源,等于把一套经过验证的参考实现直接交到开发者手里。

这批工具建立在华为既有的 CANN 软件平台之上,后者是昇腾运行 AI 负载的底层基础设施。

更关键的是接口习惯。DeepGEMM-Ascend 与既有 DeepGEMM 共用一套 API,TileLang 又同时对英伟达 GPU 可用——开发者可以在同一套代码习惯里切换硬件后端,迁移成本被压到最低。

发布距华为新芯仅两周

时间点同样值得琢磨:这次开源距离华为发布新一代 AI 处理器和超节点系统只有两周。华为表示,预计其 AI 系统将在 2027 年被广泛用于模型训练。换句话说,华为把“大规模上训练”的时间表押在了 2027 年,而 DeepSeek 现在的开源动作,正是为那个时间点提前铺路。

两家公司的合作也不是从零开始。DeepSeek 的 V4 模型 4 月已以预览形式发布,支持华为昇腾芯片;华为称其昇腾 950 超节点完全支持 V4 模型,V4-Flash 轻量版的部分训练同样用上了昇腾芯片。

对国内开发者而言,这次开源的实际价值在于:迁往昇腾不必从零摸索,接口熟悉、优化代码可查,高层语言又保留了跨平台的选择权。

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐