DeepSeek 开源昇腾「六件套」,TileLang 硬刚 CUDA!国产算力软件栈,真的要翻身了?
9 月 30 日,DeepSeek 干了一件可能改变国产 AI 格局的事:把训练自家大模型的那套底层软件,全部开源给了华为昇腾芯片。
中心是一套叫 TileLang 的编程语言,外界直接把它称为「中国版 CUDA」。
很多人盯着芯片性能看热闹,但真正的行家一眼就看出:DeepSeek 这次打的,是英伟达最坚固的那道墙——不是硬件,是软件生态。
这篇文章,我带你把这个「六件套」拆开揉碎,讲清楚它为什么重要、能走多远,以及作为开发者,你该不该现在就开始学。
一、9 月 30 日到底发生了什么?
一句话概括:DeepSeek 通过官方微信公众号宣布,开源一整套面向华为昇腾 AI 芯片的编程工具链,共六个模块,华为全程参与支持。
关键信息先给你划重点:
- 六件套:TileLang(内核编程语言)+ 五个配套组件(DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect);
- 对标对象:英伟达的 CUDA 生态;
- 官方定位:DeepSeek 称这套工具是它「做 AGI 研究的核心工具」,训练 V4 系列大模型的绝大多数算子都基于 TileLang 实现;
- 配套硬件:双方联合调优了一个由 128 块昇腾 950 芯片组成的「超节点」;
- 落地规模:DeepSeek 计划在内蒙古建一个部署至少 16 万块昇腾加速器的数据中心。
为什么这则消息分量这么重?因为它戳中了中国 AI 产业多年来的一个隐痛:芯片能造出来,但软件生态跟不上,导致「有芯无用」。
二、先破一个认知:CUDA 的护城河,从来不是芯片
很多人以为英伟达的霸权靠的是显卡性能。错了。性能只是门票,真正的护城河是 CUDA 软件生态。
有几个数字能说明问题:
- 全球大约有 400 万开发者写过 CUDA 代码;
- 十几年积累下来的优化算子库(cuDNN、cuBLAS、TensorRT……)、教程、社区问答、第三方工具,形成了一道极高的迁移成本墙;
- 对很多团队来说,选英伟达不是因为芯片最快,而是因为「工具链好用、出了问题网上有人答」。
所以美国出口管制卡住先进芯片,真正卡的其实是——中国就算造出了够用的芯片,没有配套软件,开发者也不愿意迁移。 这才是「卡脖子」最狠的一层。
DeepSeek 这次的动作,本质上是往这道墙上凿洞:它把训练前沿大模型真正用到的那套算子库,公开给昇腾,等于替所有想上国产芯片的团队,把最难啃的软件迁移活干了一大半。
一个很形象的类比:CUDA 生态是一套运营了十几年的「高速公路 + 服务区 + 导航 + 4S 店」体系。DeepSeek 这次不是修了一条新路,而是直接给昇腾配上了全套服务设施,让后来的人能直接上路跑。
三、六件套拆解:每一个都是训练大模型的刚需
这套工具不是「为了开源而开源」的噱头,它里面的每一个模块,都是训练和推理一个前沿大模型绕不开的环节。我做成一张表给你看:
| 模块 | 干什么用的 | 对应英伟达生态里的角色 |
|---|---|---|
| TileLang | Tile 化内核编程语言,写高性能算子的「语法」 | 对标 CUDA C |
| DeepGEMM-Ascend | 矩阵乘法算子库(神经网络的核心运算) | 对标 cuBLAS |
| DeepEP-Ascend | 大规模集群通信库(多卡协同训练/推理) | 对标 NCCL |
| TileKernels | 通用向量运算与内存访问算子 | 对标 CUDA 的基础 kernel |
| FlashMLA | 多头潜在注意力(MLA)算子,长文本场景 | 对标 FlashAttention |
| DeepSelect | 数据过滤工具 | 数据预处理环节 |
看这张表你就懂了:这六个模块,恰好覆盖了「训练一个大模型」从数据、到计算、到通信的完整链路。
而每一个模块,都对应着 DeepSeek 此前已经为英伟达芯片开源的同名工具。也就是说,DeepSeek 把自己的「英伟达全家桶」完整复刻了一份「昇腾版」。
其中有一个细节特别值得注意——TileKernels 做到了「一套 Python 接口、两套底层」:同一段代码,跑在英伟达 GPU 上自动走 CUDA 实现,跑在华为 NPU 上自动走昇腾实现,由程序在运行时自己选择。这对开发者意味着什么?迁移成本被压到了最低——你几乎不用改代码,换个后端就行。
四、重点讲 TileLang:它凭什么敢叫「中国版 CUDA」?
六个模块里,真正的 C 位是 TileLang。这是理解整件事的关键。
4.1 它是什么?
TileLang 是一种 Tile-based(分块)的内核编程语言。它的核心思想是:写高性能算子时,你思考的单元不是「一个个线程」,而是「一块块数据」(Tile)。
CUDA 编程为什么难?因为你要手动管理线程、线程块、共享内存、显存层级,写一个高效的矩阵乘法要操心一大堆底层细节。这是 CUDA 十几年来让无数人劝退的门槛。
TileLang 的思路是把这些复杂度抽象掉:你只需要描述「数据怎么分块、块与块之间怎么流动」,编译器负责把它翻译成高效的底层代码。用更少的心智负担,逼近硬件的性能上限。
一个概念性的对比(示意代码,帮助理解思想,非可运行源码):
# 传统 CUDA 思路:你脑子里要装着一堆线程、block、shared memory
# 一个矩阵乘法的 kernel 动辄上百行,还容易写出低效实现
# TileLang 思路:描述"数据分块 + 块间搬运"即可
@tile_kernel
def matmul(A: Tile[128, 128], B: Tile[128, 128], C: Tile[128, 128]):
# 把大矩阵切成 128x128 的块,块内并行算,块间按需搬运
C[...] = A @ B
# 编译器自动处理:调度、同步、内存层级、向量化
(注:以上为帮助理解的示意伪代码,非 TileLang 真实 API;真实写法涉及更细的 tile 布局与流水线标注。)
把两者放在一起对比,差异会更直观:
| 维度 | CUDA | TileLang |
|---|---|---|
| 编程单元 | 线程 / 线程块 / 网格 | 数据块(Tile) |
| 内存管理 | 手动管理显存层级、共享内存 | 编译器自动处理 |
| 线程同步 | 手动写同步逻辑,极易出错 | 自动调度与同步 |
| 上手门槛 | 高,需理解 GPU 底层架构 | 相对低,描述数据流即可 |
| 性能天花板 | 极高,充分优化可逼近理论极限 | 高,官方称关键算子达 95% 硬件极限 |
| 生态成熟度 | 十几年积累,极成熟 | 早期,正在构建中 |
一句话概括两者的关系:CUDA 像手动挡,掌控一切但门槛高;TileLang 像自动挡,牺牲一点极致自由度,换取大幅降低的上手成本。 对一个想要「更快上手国产芯片」的新生态来说,后者显然更友好。
4.2 它从哪来?
一个很多人不知道的背景:TileLang 最早不是 DeepSeek 发明的,而是 2025 年初由北京大学的研究者提出。DeepSeek 在英伟达老芯片上做了充分验证后,把它当成了自己的主力工具,随后一路推进到昇腾平台。
这个出身决定了它的一个独特优势——它不绑定任何一家硬件厂商。TileLang 的位置在「模型」和「芯片」之间:芯片厂商只需要提供编译后端和底层指令接口,上层基于 TileLang 写的算子生态就能复用。
这句话的分量,我们放到第六节专门展开。
4.3 怎么上手:核心仓库已经全部公开
这套工具不是 PPT 发布,是真金白银地放到了 GitHub 上。想上手,核心仓库先 clone 下来:
# TileLang 昇腾后端(内核编程语言)
git clone https://github.com/tile-ai/tilelang-ascend.git
# DeepSeek 昇腾矩阵乘法算子库(对标 cuBLAS)
git clone https://github.com/deepseek-ai/DeepGEMM-Ascend.git
# DeepSeek 昇腾通信库(多卡协同训练/推理,对标 NCCL)
git clone https://github.com/deepseek-ai/DeepEP-Ascend.git
需要提醒一句:这几个仓库仍依赖华为的 CANN 计算软件层才能跑起来,也就是说,上手前提是你手上得有昇腾的硬件环境或云资源。对绝大多数人来说,现阶段更现实的是「先读代码、先理解思想」,而不是急着跑通。
五、性能到底行不行?看数据,别听口号
「对标 CUDA」这话谁都会说,关键看数字。DeepSeek 这次给了几个硬指标:
| 测试项 | 实测性能 | 相对硬件理论极限 |
|---|---|---|
| 昇腾 950 稀疏注意力算子(读取/输入阶段) | 410 TFlops | 95% |
| 昇腾 950 稀疏注意力算子(生成/逐步输出阶段) | 360 TFlops | 83% |
翻译成人话:在关键算子上,DeepSeek 已经把昇腾 950 压榨到了接近硬件物理极限的程度。
这背后的工程意义是什么?要知道,一块芯片的「纸面算力」和「实际能跑出来的算力」之间,往往隔着巨大的差距——差的这一截,就是软件优化的功夫。能把利用率做到 95%,说明这套软件栈在「充分释放硬件性能」这件事上,已经达到了相当高的成熟度。
不过,这里我必须给你泼一盆冷水,保持冷静(第六节细说):这些数字目前是 DeepSeek 单方面公布的,还没有经过第三方独立验证。 真实世界的采纳情况,要看它是否稳定、可扩展、且「DeepSeek 之外的团队」也能用好。
六、真正的深意:国产芯片第一次「共享算子生态」
如果只看到「华为芯片 + DeepSeek 软件」,你就只看到了第一层。往深一层看,这件事的战略意义大得多。
长期以来,国产 AI 芯片最大的问题不是「造不出来」,而是「各自为战」:
- 寒武纪、海光、摩尔线程、沐曦……每一家都有自己的一套软件体系;
- 模型厂商每适配一家芯片,都是一次全新的迁移,开发资源被反复消耗;
- 没有统一的算子生态,开发者就不愿意来,开发者不来,生态就更荒——这是个死循环。
而 TileLang 的位置,恰好打破了这种割裂。因为它不归属任何一家硬件厂商:
芯片厂商只需要提供「编译后端 + 底层指令接口」,上层基于 TileLang 写的算子生态,就能被所有芯片复用。
昇腾这次开放了 Ascend C 与 PTO ISA 底层指令体系,就是迈出了「让算子生态跨芯片复用」的第一步。
这意味着什么?如果这条路走通,未来国产芯片可能第一次拥有一个「共享的算子生态」——就像英伟达的 CUDA 生态里,开发者写一次代码,N 卡都能跑。这对整个国产 AI 产业的想象力,远超任何单款芯片的性能参数。
用一句大白话总结:DeepSeek 这次不只是在帮华为,它是在试图给整个国产芯片产业,铺一条「共享的软件地基」。
七、这不是突袭,是一场蓄谋已久的布局
如果你以为这是 DeepSeek 一拍脑袋的「突袭」,就把它看浅了。把时间线拉出来,你会发现这是一场谋划了一年多的「明牌」:
| 时间 | 事件 | 信号 |
|---|---|---|
| 2025-08 | DeepSeek 发布 V3.1,采用 UE8M0 FP8 数据格式 | 官方明说「为下一代国产芯片设计」 |
| 2025-09-29 | V3.2-Exp 发布并开放算子实现,昇腾同日完成适配,TileLang-Ascend 当天开源 | 模型方与芯片方开始深度协同 |
| 2026-04-24 | V4 预览版发布,华为宣布 V4 在昇腾首发,多家国产芯片厂商跟进适配 | 国产芯片首次承接前沿模型「首发」 |
| 2026-09-30 | 开源昇腾「六件套」,联合调优 128 卡超节点 | 把训练底层工具链整体开放 |
这张时间线透露了一个清晰的信息:DeepSeek 和华为的协同,是从「模型设计阶段」就开始的,而不是事后补适配。
尤其 2025 年 8 月那个「UE8M0 FP8」格式的细节很妙——DeepSeek 在设计模型时,就直接按照国产芯片的能力来定数据格式。这意味着未来国产芯片不再是「追赶者被动适配前沿模型」,而是「从一开始就被纳入模型设计」的参与者。角色变了,格局就变了。
八、冷静一点:现实里的三道坎,一道都绕不过去
说了这么多「重大意义」,如果不讲清楚局限,就是不负责任。摆在 TileLang + 昇腾面前的三道坎,一道比一道硬:
第一道坎:性能差距依然存在。 更早的公开报告显示,华为昇腾 910C 的推理性能大约是英伟达 H100 的 60%。昇腾 950 虽然更强,但至今没有经过大规模独立基准测试。纸面数据再漂亮,也要等第三方实测说话。
第二道坎:软件生态的差距是全方位的。 DeepSeek 开源的六件套,解决的是「核心算子」这一环。但 CUDA 生态里还有 profiler(性能分析器)、调试工具、PyTorch 算子覆盖率、社区知识沉淀……这些「周边」的完善程度,昇腾离 CUDA 还有相当距离。换芯片,从来不只是换几个算子,是换掉一整套日常工具链。
第三道坎:地缘政治的不确定性。 全球开发者对这套工具的态度是分裂的——海外团队会担心长期支持、供应链、合规风险;国内团队虽然热情高,但要真正迁移生产环境,也需要时间和成本。
所以我的判断是:这是一次意义重大的「破冰」,但离「翻身」还有很长的路。 它解决的是「从 0 到 1」的可用性问题,而「从 1 到 100」的生态繁荣,需要的是年复一年的迭代、文档、bug 修复和第三方验证——这恰恰是英伟达花了十几年才攒下的家底。
九、作为开发者,你该现在就开始学吗?
这是大家最关心的问题,我分人群给建议:
如果你在国产芯片相关赛道(AI 基础设施、云厂商、信创项目):现在就该关注。 这是趋势,早学早占位。TileLang 的门槛比 CUDA 低,上手曲线更友好,值得投入时间。
如果你是普通应用层开发者(写业务、做 Web、做 App):暂时不用焦虑。 你离「手写算子」还很远,你的日常是调 API、写业务逻辑,这套东西跟你关系不大。保持关注即可。
如果你想在 AI 底层方向建立差异化竞争力:这是一个值得押注的时间窗口。 国产算力软件栈的人才,未来几年会很稀缺。现在入局,窗口期正好。
不过无论哪类人,记住一条:不要因为「国产」两个字就盲目乐观,也不要因为「差距」两个字就盲目唱衰。 理性看待——它在解决真问题,但离「全面对标 CUDA」还早。
十、结语:软件,才是这场博弈里最被低估的胜负手
很多人看 AI 芯片之争,只盯着晶体管数量、算力 TFLOPS。但 DeepSeek 这次用行动提醒了所有人一个朴素的事实:
芯片决定下限,软件决定上限。
英伟达用 CUDA 生态筑起了十几年的护城河,而 DeepSeek 开源昇腾六件套,是中国团队第一次系统性地、从软件层面对这道护城河发起正面冲击。成败尚早,但方向清晰了。
对普通开发者来说,这轮变革最值得记住的一句话是:当「硬件」开始可替代,「软件生态」就成了新的主战场——而生态,从来都是靠无数个开发者一行一行代码、一篇一篇文档垒起来的。
国产算力软件栈能不能真正翻身,答案不在 DeepSeek 一家身上,而在每一个愿意进来踩坑、贡献、复用的开发者身上。
你怎么看这波国产算力软件栈的突围?是「真破冰」还是「概念先行」?评论区聊聊你的判断。
本文信息综合自 DeepSeek 官方公告、Reuters、Bloomberg、SCMP、The New York Times、The Next Web 等公开报道,数据截至 2026 年 10 月 2 日。性能数据为 DeepSeek 官方口径,尚未经第三方独立验证,请理性参考。
更多推荐



所有评论(0)