DeepSeek开源昇腾版基础组件:国产AI芯片的软件栈补到了哪一步
9月30日,DeepSeek官方公众号宣布,正式开源一批面向华为昇腾算力平台的基础设施组件,涵盖高级语言编译工具、高性能计算库和分布式通信库。官方说法是:这批组件与它此前面向英伟达平台开源的组件一一对应。
说白了,就是以前只在英伟达卡上能用的那套底层家伙什,现在昇腾上也有了对应的版本。对做国产化适配的团队来说,这是件需要认真看一眼的事。
这次到底开源了什么
据报道,本次开源的组件大致分三类:
- TileLang(昇腾版):高级语言编译工具。它对昇腾底层的 Ascend C 指令做了封装,让开发者用高级语言写算子,而不是直接啃底层指令。
-
- 计算类库:DeepGEMM(通用矩阵运算)、TileKernels(常规向量计算与访存算子)、FlashMLA(稀疏注意力算子,用于长上下文)、DeepSelect(数据筛选)。
-
- 通信类库:DeepEP(大规模跨设备通信),覆盖 EP / CP / PP / FSDP 等并行模式下的通信算子。
DeepSeek 表示,在多项关键测试用例里,这些组件的计算与通信性能"已接近硬件上限"。通信侧给出的实测数据是 Dispatch 375 GB/s、Combine 347 GB/s,这属于需要谨慎看待的厂商披露口径,但方向是清楚的:冲着硬件极限去的。
- 通信类库:DeepEP(大规模跨设备通信),覆盖 EP / CP / PP / FSDP 等并行模式下的通信算子。
技术本质上,变的是什么
大模型这行有个常被忽略的事实:芯片的理论算力只是起点,真正决定跑得多快的是算子实现。 模型里的矩阵乘怎么拆、数据怎么搬、计算和访存怎么衔接,这些活儿大部分落在算子上。同样的卡,算子写得好不好,性能能差出好几倍。
英伟达这些年真正的护城河,不只是硬件,而是 CUDA 那一整套软件生态——库、编译器、调试工具、几十年积累的文档和社区。换硬件不难,换生态极难。
所以这次开源的核心意义不是"出了一批新库",而是国产芯片的软件栈开始有人按统一范式补齐了。TileLang 的价值在于它把"写算子"这件事的门槛往下拉:以前在昇腾上做高性能算子得写 Ascend C,现在可以用更接近高级语言的写法。据报道,DeepSeek V4 系列训练里大部分算子都是用 TileLang 实现的,这说明它已经在真实的大规模训练里跑过,不是纸面工具。
另一个信号是合作深度。据报道,华为提供了联合定义的昇腾超节点 SuperPoD Flex 和 UBL128 组网方案,可实现 128 卡 3.2Tbps 单层交换,双方还在推进基于昇腾 950 的 128 卡超节点方案。这种"模型厂商 + 芯片厂商一起调通信"的打法,比单纯买卡要扎实得多。
没变的,也得说清楚
一句"一一对应",很容易被读成"昇腾上啥都能直接跑"。实际没这么简单:
- 组件对应 ≠ 模型零成本迁移。 底层库有了,不代表你现有的训练/推理代码改个环境变量就能在昇腾上跑。算子、并行策略、精度对齐都要重新验证。
-
- 生态成熟度仍有差距。 CUDA 十几年的积累,不是一次开源能追平的。遇到奇怪问题时的资料、社区、踩坑记录,昇腾这边还是少。
-
- 大多数人的日常不会立刻改变。 如果你平时是调云 API、或者在公司用英伟达卡,这次开源短期内跟你关系不大——除非你所在的团队正好在做信创、国产化替代。
判断一个算子值不值得自己写,本质上是在算计算强度和访存开销的比值。下面这段是最小可运行的演示,能帮你建立个直觉:
- 大多数人的日常不会立刻改变。 如果你平时是调云 API、或者在公司用英伟达卡,这次开源短期内跟你关系不大——除非你所在的团队正好在做信创、国产化替代。
def arithmetic_intensity(m, n, k, bytes_per_elem=2):
"""矩阵乘 C[m,n] = A[m,k] @ B[k,n] 的算术强度(FLOP/Byte)。
bytes_per_elem=2 对应 FP16/BF16。"""
flops = 2 * m * n * k
bytes_moved = (m * k + k * n + m * n) * bytes_per_elem
return flops / bytes_moved
# 典型大矩阵乘
print(f"{arithmetic_intensity(4096, 4096, 4096):.1f} FLOP/Byte")
算术强度越高,越容易吃满算力;越低,越容易被内存带宽卡住。你判断自家模型里哪块该优化时,可以用这个思路先排个序。
对从业者意味着什么
- 做信创/国产化项目的:值得把 TileLang 和这几个库拉下来评估。至少现在有个"官方在维护"的选项,比几年前自己硬啃强。
-
- 只想把模型跑起来的:继续用主流云服务,别为了尝鲜去折腾硬件迁移。
-
- 想往底层走的开发者:算子、通信、编译器这块,国产生态正在补人,这是个相对稀缺的方向。
要留意的坑:开源组件版本迭代可能很快,接口不一定稳;厂商披露的性能数据基本都是"关键用例 + 最佳配置",生产环境里打个折再规划。
- 想往底层走的开发者:算子、通信、编译器这块,国产生态正在补人,这是个相对稀缺的方向。
国产算力的软件栈这一两年确实在往前挪,但别指望一次开源就变天。真正的考验是:半年后,有多少团队能真的在上面跑通自己的模型。
你怎么看国产算力生态的进度?评论区聊聊。
更多推荐



所有评论(0)