9 月 30 日,DeepSeek 干了一件可能改变国产 AI 格局的事:把训练自家大模型的那套底层软件,全部开源给了华为昇腾芯片。

中心是一套叫 TileLang 的编程语言,外界直接把它称为「中国版 CUDA」。

很多人盯着芯片性能看热闹,但真正的行家一眼就看出:DeepSeek 这次打的,是英伟达最坚固的那道墙——不是硬件,是软件生态。

这篇文章,我带你把这个「六件套」拆开揉碎,讲清楚它为什么重要、能走多远,以及作为开发者,你该不该现在就开始学。


一、9 月 30 日到底发生了什么?

一句话概括:DeepSeek 通过官方微信公众号宣布,开源一整套面向华为昇腾 AI 芯片的编程工具链,共六个模块,华为全程参与支持。

关键信息先给你划重点:

  • 六件套:TileLang(内核编程语言)+ 五个配套组件(DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect);
  • 对标对象:英伟达的 CUDA 生态;
  • 官方定位:DeepSeek 称这套工具是它「做 AGI 研究的核心工具」,训练 V4 系列大模型的绝大多数算子都基于 TileLang 实现;
  • 配套硬件:双方联合调优了一个由 128 块昇腾 950 芯片组成的「超节点」;
  • 落地规模:DeepSeek 计划在内蒙古建一个部署至少 16 万块昇腾加速器的数据中心。

为什么这则消息分量这么重?因为它戳中了中国 AI 产业多年来的一个隐痛:芯片能造出来,但软件生态跟不上,导致「有芯无用」。


二、先破一个认知:CUDA 的护城河,从来不是芯片

很多人以为英伟达的霸权靠的是显卡性能。错了。性能只是门票,真正的护城河是 CUDA 软件生态。

有几个数字能说明问题:

  • 全球大约有 400 万开发者写过 CUDA 代码;
  • 十几年积累下来的优化算子库(cuDNN、cuBLAS、TensorRT……)、教程、社区问答、第三方工具,形成了一道极高的迁移成本墙;
  • 对很多团队来说,选英伟达不是因为芯片最快,而是因为「工具链好用、出了问题网上有人答」。

所以美国出口管制卡住先进芯片,真正卡的其实是——中国就算造出了够用的芯片,没有配套软件,开发者也不愿意迁移。 这才是「卡脖子」最狠的一层。

DeepSeek 这次的动作,本质上是往这道墙上凿洞:它把训练前沿大模型真正用到的那套算子库,公开给昇腾,等于替所有想上国产芯片的团队,把最难啃的软件迁移活干了一大半。

一个很形象的类比:CUDA 生态是一套运营了十几年的「高速公路 + 服务区 + 导航 + 4S 店」体系。DeepSeek 这次不是修了一条新路,而是直接给昇腾配上了全套服务设施,让后来的人能直接上路跑。


三、六件套拆解:每一个都是训练大模型的刚需

这套工具不是「为了开源而开源」的噱头,它里面的每一个模块,都是训练和推理一个前沿大模型绕不开的环节。我做成一张表给你看:

模块干什么用的对应英伟达生态里的角色
TileLangTile 化内核编程语言,写高性能算子的「语法」对标 CUDA C
DeepGEMM-Ascend矩阵乘法算子库(神经网络的核心运算)对标 cuBLAS
DeepEP-Ascend大规模集群通信库(多卡协同训练/推理)对标 NCCL
TileKernels通用向量运算与内存访问算子对标 CUDA 的基础 kernel
FlashMLA多头潜在注意力(MLA)算子,长文本场景对标 FlashAttention
DeepSelect数据过滤工具数据预处理环节

看这张表你就懂了:这六个模块,恰好覆盖了「训练一个大模型」从数据、到计算、到通信的完整链路。

而每一个模块,都对应着 DeepSeek 此前已经为英伟达芯片开源的同名工具。也就是说,DeepSeek 把自己的「英伟达全家桶」完整复刻了一份「昇腾版」。

其中有一个细节特别值得注意——TileKernels 做到了「一套 Python 接口、两套底层」:同一段代码,跑在英伟达 GPU 上自动走 CUDA 实现,跑在华为 NPU 上自动走昇腾实现,由程序在运行时自己选择。这对开发者意味着什么?迁移成本被压到了最低——你几乎不用改代码,换个后端就行。


四、重点讲 TileLang:它凭什么敢叫「中国版 CUDA」?

六个模块里,真正的 C 位是 TileLang。这是理解整件事的关键。

4.1 它是什么?

TileLang 是一种 Tile-based(分块)的内核编程语言。它的核心思想是:写高性能算子时,你思考的单元不是「一个个线程」,而是「一块块数据」(Tile)。

CUDA 编程为什么难?因为你要手动管理线程、线程块、共享内存、显存层级,写一个高效的矩阵乘法要操心一大堆底层细节。这是 CUDA 十几年来让无数人劝退的门槛。

TileLang 的思路是把这些复杂度抽象掉:你只需要描述「数据怎么分块、块与块之间怎么流动」,编译器负责把它翻译成高效的底层代码。用更少的心智负担,逼近硬件的性能上限。

一个概念性的对比(示意代码,帮助理解思想,非可运行源码):

# 传统 CUDA 思路:你脑子里要装着一堆线程、block、shared memory
# 一个矩阵乘法的 kernel 动辄上百行,还容易写出低效实现

# TileLang 思路:描述"数据分块 + 块间搬运"即可
@tile_kernel
def matmul(A: Tile[128, 128], B: Tile[128, 128], C: Tile[128, 128]):
    # 把大矩阵切成 128x128 的块,块内并行算,块间按需搬运
    C[...] = A @ B
    # 编译器自动处理:调度、同步、内存层级、向量化

(注:以上为帮助理解的示意伪代码,非 TileLang 真实 API;真实写法涉及更细的 tile 布局与流水线标注。)

把两者放在一起对比,差异会更直观:

维度CUDATileLang
编程单元线程 / 线程块 / 网格数据块(Tile)
内存管理手动管理显存层级、共享内存编译器自动处理
线程同步手动写同步逻辑,极易出错自动调度与同步
上手门槛高,需理解 GPU 底层架构相对低,描述数据流即可
性能天花板极高,充分优化可逼近理论极限高,官方称关键算子达 95% 硬件极限
生态成熟度十几年积累,极成熟早期,正在构建中

一句话概括两者的关系:CUDA 像手动挡,掌控一切但门槛高;TileLang 像自动挡,牺牲一点极致自由度,换取大幅降低的上手成本。 对一个想要「更快上手国产芯片」的新生态来说,后者显然更友好。

4.2 它从哪来?

一个很多人不知道的背景:TileLang 最早不是 DeepSeek 发明的,而是 2025 年初由北京大学的研究者提出。DeepSeek 在英伟达老芯片上做了充分验证后,把它当成了自己的主力工具,随后一路推进到昇腾平台。

这个出身决定了它的一个独特优势——它不绑定任何一家硬件厂商。TileLang 的位置在「模型」和「芯片」之间:芯片厂商只需要提供编译后端和底层指令接口,上层基于 TileLang 写的算子生态就能复用。

这句话的分量,我们放到第六节专门展开。

4.3 怎么上手:核心仓库已经全部公开

这套工具不是 PPT 发布,是真金白银地放到了 GitHub 上。想上手,核心仓库先 clone 下来:

# TileLang 昇腾后端(内核编程语言)
git clone https://github.com/tile-ai/tilelang-ascend.git

# DeepSeek 昇腾矩阵乘法算子库(对标 cuBLAS)
git clone https://github.com/deepseek-ai/DeepGEMM-Ascend.git

# DeepSeek 昇腾通信库(多卡协同训练/推理,对标 NCCL)
git clone https://github.com/deepseek-ai/DeepEP-Ascend.git

需要提醒一句:这几个仓库仍依赖华为的 CANN 计算软件层才能跑起来,也就是说,上手前提是你手上得有昇腾的硬件环境或云资源。对绝大多数人来说,现阶段更现实的是「先读代码、先理解思想」,而不是急着跑通。


五、性能到底行不行?看数据,别听口号

「对标 CUDA」这话谁都会说,关键看数字。DeepSeek 这次给了几个硬指标:

测试项实测性能相对硬件理论极限
昇腾 950 稀疏注意力算子(读取/输入阶段)410 TFlops95%
昇腾 950 稀疏注意力算子(生成/逐步输出阶段)360 TFlops83%

翻译成人话:在关键算子上,DeepSeek 已经把昇腾 950 压榨到了接近硬件物理极限的程度。

这背后的工程意义是什么?要知道,一块芯片的「纸面算力」和「实际能跑出来的算力」之间,往往隔着巨大的差距——差的这一截,就是软件优化的功夫。能把利用率做到 95%,说明这套软件栈在「充分释放硬件性能」这件事上,已经达到了相当高的成熟度。

不过,这里我必须给你泼一盆冷水,保持冷静(第六节细说):这些数字目前是 DeepSeek 单方面公布的,还没有经过第三方独立验证。 真实世界的采纳情况,要看它是否稳定、可扩展、且「DeepSeek 之外的团队」也能用好。


六、真正的深意:国产芯片第一次「共享算子生态」

如果只看到「华为芯片 + DeepSeek 软件」,你就只看到了第一层。往深一层看,这件事的战略意义大得多。

长期以来,国产 AI 芯片最大的问题不是「造不出来」,而是「各自为战」:

  • 寒武纪、海光、摩尔线程、沐曦……每一家都有自己的一套软件体系;
  • 模型厂商每适配一家芯片,都是一次全新的迁移,开发资源被反复消耗;
  • 没有统一的算子生态,开发者就不愿意来,开发者不来,生态就更荒——这是个死循环。

而 TileLang 的位置,恰好打破了这种割裂。因为它不归属任何一家硬件厂商:

芯片厂商只需要提供「编译后端 + 底层指令接口」,上层基于 TileLang 写的算子生态,就能被所有芯片复用。

昇腾这次开放了 Ascend C 与 PTO ISA 底层指令体系,就是迈出了「让算子生态跨芯片复用」的第一步。

这意味着什么?如果这条路走通,未来国产芯片可能第一次拥有一个「共享的算子生态」——就像英伟达的 CUDA 生态里,开发者写一次代码,N 卡都能跑。这对整个国产 AI 产业的想象力,远超任何单款芯片的性能参数。

用一句大白话总结:DeepSeek 这次不只是在帮华为,它是在试图给整个国产芯片产业,铺一条「共享的软件地基」。


七、这不是突袭,是一场蓄谋已久的布局

如果你以为这是 DeepSeek 一拍脑袋的「突袭」,就把它看浅了。把时间线拉出来,你会发现这是一场谋划了一年多的「明牌」:

时间事件信号
2025-08DeepSeek 发布 V3.1,采用 UE8M0 FP8 数据格式官方明说「为下一代国产芯片设计」
2025-09-29V3.2-Exp 发布并开放算子实现,昇腾同日完成适配,TileLang-Ascend 当天开源模型方与芯片方开始深度协同
2026-04-24V4 预览版发布,华为宣布 V4 在昇腾首发,多家国产芯片厂商跟进适配国产芯片首次承接前沿模型「首发」
2026-09-30开源昇腾「六件套」,联合调优 128 卡超节点把训练底层工具链整体开放

这张时间线透露了一个清晰的信息:DeepSeek 和华为的协同,是从「模型设计阶段」就开始的,而不是事后补适配。

尤其 2025 年 8 月那个「UE8M0 FP8」格式的细节很妙——DeepSeek 在设计模型时,就直接按照国产芯片的能力来定数据格式。这意味着未来国产芯片不再是「追赶者被动适配前沿模型」,而是「从一开始就被纳入模型设计」的参与者。角色变了,格局就变了。


八、冷静一点:现实里的三道坎,一道都绕不过去

说了这么多「重大意义」,如果不讲清楚局限,就是不负责任。摆在 TileLang + 昇腾面前的三道坎,一道比一道硬:

第一道坎:性能差距依然存在。 更早的公开报告显示,华为昇腾 910C 的推理性能大约是英伟达 H100 的 60%。昇腾 950 虽然更强,但至今没有经过大规模独立基准测试。纸面数据再漂亮,也要等第三方实测说话。

第二道坎:软件生态的差距是全方位的。 DeepSeek 开源的六件套,解决的是「核心算子」这一环。但 CUDA 生态里还有 profiler(性能分析器)、调试工具、PyTorch 算子覆盖率、社区知识沉淀……这些「周边」的完善程度,昇腾离 CUDA 还有相当距离。换芯片,从来不只是换几个算子,是换掉一整套日常工具链。

第三道坎:地缘政治的不确定性。 全球开发者对这套工具的态度是分裂的——海外团队会担心长期支持、供应链、合规风险;国内团队虽然热情高,但要真正迁移生产环境,也需要时间和成本。

所以我的判断是:这是一次意义重大的「破冰」,但离「翻身」还有很长的路。 它解决的是「从 0 到 1」的可用性问题,而「从 1 到 100」的生态繁荣,需要的是年复一年的迭代、文档、bug 修复和第三方验证——这恰恰是英伟达花了十几年才攒下的家底。


九、作为开发者,你该现在就开始学吗?

这是大家最关心的问题,我分人群给建议:

如果你在国产芯片相关赛道(AI 基础设施、云厂商、信创项目):现在就该关注。 这是趋势,早学早占位。TileLang 的门槛比 CUDA 低,上手曲线更友好,值得投入时间。

如果你是普通应用层开发者(写业务、做 Web、做 App):暂时不用焦虑。 你离「手写算子」还很远,你的日常是调 API、写业务逻辑,这套东西跟你关系不大。保持关注即可。

如果你想在 AI 底层方向建立差异化竞争力:这是一个值得押注的时间窗口。 国产算力软件栈的人才,未来几年会很稀缺。现在入局,窗口期正好。

不过无论哪类人,记住一条:不要因为「国产」两个字就盲目乐观,也不要因为「差距」两个字就盲目唱衰。 理性看待——它在解决真问题,但离「全面对标 CUDA」还早。


十、结语:软件,才是这场博弈里最被低估的胜负手

很多人看 AI 芯片之争,只盯着晶体管数量、算力 TFLOPS。但 DeepSeek 这次用行动提醒了所有人一个朴素的事实:

芯片决定下限,软件决定上限。

英伟达用 CUDA 生态筑起了十几年的护城河,而 DeepSeek 开源昇腾六件套,是中国团队第一次系统性地、从软件层面对这道护城河发起正面冲击。成败尚早,但方向清晰了。

对普通开发者来说,这轮变革最值得记住的一句话是:当「硬件」开始可替代,「软件生态」就成了新的主战场——而生态,从来都是靠无数个开发者一行一行代码、一篇一篇文档垒起来的。

国产算力软件栈能不能真正翻身,答案不在 DeepSeek 一家身上,而在每一个愿意进来踩坑、贡献、复用的开发者身上。

你怎么看这波国产算力软件栈的突围?是「真破冰」还是「概念先行」?评论区聊聊你的判断。


本文信息综合自 DeepSeek 官方公告、Reuters、Bloomberg、SCMP、The New York Times、The Next Web 等公开报道,数据截至 2026 年 10 月 2 日。性能数据为 DeepSeek 官方口径,尚未经第三方独立验证,请理性参考。

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐