DeepSeek把6个基础组件开源给昇腾:国产算力的软件底座补上了多少
9月30日,DeepSeek 宣布开源一套面向华为昇腾(Ascend)算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、高性能计算库和分布式通信库。据多家媒体报道,这批组件与 DeepSeek 此前给英伟达平台开源的组件一一对应。
这条新闻没有"发布新模型"那么抓眼球,所以热度不算高。但对做大模型训练或推理部署的人来说,它可能是近期最值得看一眼的技术事件之一——因为它动的是地基,不是外墙。
这次到底开源了什么
据公开信息,这次放出来的不是能直接聊天的产品,而是大模型跑起来时底层要用的"零部件",大致按功能可以分成这几类:
- TileLang(昇腾版):高级语言编译工具。对昇腾 Ascend C 底层指令做封装,让开发者用更接近高级语言的方式写算子,官方称不损失硬件性能。
-
- DeepGEMM:通用矩阵运算加速,管"算"。
-
- DeepEP:大规模跨设备通信,主要服务专家并行(EP)等场景,管"搬数据"。
-
- TileKernels:常规向量计算和访存算子。
-
- FlashMLA:稀疏注意力算子,用于提升长上下文处理效率。
-
- DeepSelect:高效的数据筛选。
一句话概括:矩阵运算、跨卡通信、注意力计算——这几段最吃性能的路,在昇腾上被重新铺了一遍。
- DeepSelect:高效的数据筛选。
技术本质:是铺路,不是搬家
这里有个容易被带偏的点:不少人第一反应是"国产版 CUDA 来了"。据报道,实际情况没这么夸张。
CUDA 的价值不只是一套底层指令,而是二十年积累的框架、算子库、教程、社区,以及无数"踩过的坑"。这次开源更接近的做法是:把大模型训练里最吃紧的那几段路,在两套硬件上用同一套接口重新实现。
据技术社区的分析,几个组件里,一部分是在原有跨平台项目上新增了昇腾后端,另一部分是新仓库,但接口与英伟达版本保持对齐——上层调用几乎不用改。这才是"一一对应"真正落地的地方。
和之前比,变的是:昇腾生态过去比较薄弱的高性能算子库和编译工具链,开始由头部模型团队来补;而且是模型团队把自己训练里"用脚投票"写出来的代码直接开源,不只是芯片厂商单方面做适配。
没变的是:CUDA 生态仍然是绝大多数人的默认起点,算子覆盖度、工具链成熟度、文档和社区支持,依旧是迁移时绕不开的门槛。
涉及的工程细节与数据
据报道,这次合作还涉及昇腾 950 机型的 128 卡超节点方案。华为方面提供的组网方案包含 SuperPoD Flex 与 UBL128,可实现 128 卡 3.2Tbps 单层交换的 Scale-up 网络,以及 256K 卡两层交换的 Scale-out 网络,并提供 ASC-COMM 通信编程库。
在通信性能上,据报道 DeepEP 实测达到 Dispatch 375 GB/s、Combine 347 GB/s,接近硬件上限。通信为什么重要?因为单卡再快,如果数据不能及时到达下一步计算所在的卡,整个任务还是得等。
对开发者意味着什么
如果是做大模型训练、推理部署的工程团队,这条新闻确实和你有关,但建议按下面的节奏来:
- 先读文档,别急着上生产。 新开源的组件,文档成熟度和边界情况处理通常需要时间打磨。
-
- 做小规模验证。 挑一个非关键的业务或研究任务,先验证算子覆盖是否满足你的模型结构。
-
- 盯住算子缺失和工具链。 社区里比较一致的建议是:等商用工具链更齐全,再做生产级验证。
-
- 别把"开源了"等同于"能直接替换"。 接口对齐降低了迁移成本,但性能调优、故障排查的经验,还得自己积累。
从岗位角度看,还有一层影响:国产算力适配会带来新的工程需求,比如算子调优、跨平台迁移、性能对齐。对做运维、平台、算法的同学来说,这可能是接下来一段时间新增的技能点。
- 别把"开源了"等同于"能直接替换"。 接口对齐降低了迁移成本,但性能调优、故障排查的经验,还得自己积累。
结尾
昇腾的软件生态短板正在被一点点补上,但离"能无痛替换"还有距离。你所在的公司,会愿意为国产算力提前做技术储备,还是继续观望?你怎么看,评论区聊聊。
更多推荐



所有评论(0)