9 月 30 日上午,DeepSeek 在 GitHub 上放出了一批面向华为昇腾算力平台的基础设施组件。很多人第一反应是"又一个国产替代的进度条"。我的判断不一样:这件事真正的价值不在"国产芯片又追上了一点",而在它动的是 CUDA 最深的那道护城河,软件栈。

模型能力换代的窗口大概三五年,软件栈的迁移窗口往往十年起步。这是我愿意认真聊它的原因。

一、先看清楚开源了什么

把清单摆出来,比空谈"意义"有用。

这次开源的是和英伟达平台一一对应的一套组件。TileLang,面向昇腾的高级语言编译工具,对 Ascend C 指令做封装,用高层写法就能拿到接近手写的性能。DeepGEMM-Ascend,矩阵乘算子库,和 NVIDIA 版 DeepGEMM 完全 API 兼容,精度上从 BF16 一路支持到 FP4,另外还覆盖 MQA logits 和 MegaMoE 这类特殊算子。DeepEP-Ascend,MoE 专家并行的通信库,公开 buffer API 与 NVIDIA 版 DeepEP 对齐。此外还有几个算子库。FlashMLA 负责稀疏注意力,DeepSelect 负责稀疏注意力里的筛选,TileKernels 则用 TileLang 覆盖向量计算与访存。

我在 GitHub 上核过时间和仓库。DeepGEMM-Ascend、DeepEP-Ascend 都是 9 月 29 日晚到 30 日新建的,README 写得很直白:"developed and validated on the Ascend 950 series",在昇腾 950 系列上开发和验证,API 与英伟达版保持一致,用户装完包就能沿用原来的开发流程。DeepEP-Ascend 还直接贴了一张实测表:在昇腾 950DT 加 CANN 9.2.0 上,EP8 规模的 dispatch 带宽能跑到 373 到 375 GB/s。

单个数字没什么,连起来看信息量就出来了。这不是迁移文档,是生产环境里真在跑的实现。DeepSeek 也提到,TileLang 路线已经承载了 V4 系列训练里大部分算子,训练中用到的每一个 TileLang 算子,在昇腾上都有对应的高性能实现。

二、为什么会这样:CUDA 的护城河从来不是硬件

要理解这步棋的分量,得先说清一个被反复误读的事:CUDA 到底强在哪。

外行容易以为英伟达的壁垒是 GPU 本身。芯片参数其实追得动。这两年国产卡的单卡算力和显存带宽,和主流产品的差距一直在收窄,部分推理场景已经能接。难追的是十几年堆出来的工具链:编译器、算子库这些底层工具,以及上面那一整套开发者习惯。

这个判断不是我拍的。前阵子读到一篇行业分析,里面有句话我印象很深。很多企业买回国产算力集群,硬件通电只要几个月,把主流大模型完整迁过去、调好算子,却要投一大堆工程师,耗上更长周期。更要命的是,模型一迭代,适配工作还得重来一遍。

于是国产算力卡在一个负向循环里。开发者不熟,就缺人做迁移;上层应用少,企业就不敢买;芯片厂商拿不到足够订单,也没资金养软件栈。

DeepSeek 开源这批组件,动的就是这个循环的起点。它把"模型团队在国产芯片上跑不出性能"里最卡的软件栈环节,替行业走完了一半,算子实现和通信库、编译路径全给出来,而且和 CUDA 侧接口对齐。

它不是要再造一个 CUDA。它是把 CUDA 生态里最值钱的那一层,用开源的方式在昇腾上补齐。

背后的推手也不只是技术。往前看一个月,彭博社报道过,DeepSeek 计划在内蒙古数据中心部署至少 16 万颗昇腾 950DT。另一面是,有报道称昇腾 950DT 受高端内存良率限制,全年产量只有数十万颗,还要顾及其他客户和出口订单。换句话说,V4 系列训练目前主力还得靠英伟达,但把训练和推理的成本结构往国产平台挪,是它必须提前布局的事。开源组件,本质上是给自己未来的算力账单铺路。顺带,整个行业的路也铺了。

三、意味着什么:从"能跑"到"好用"

我更愿意把 2026 这个时间点,看成国产算力的分水岭。

CNNIC 的上半年数据能说明规模。截至 2026 年上半年,中国智能算力规模达到 2185 EFLOPS,同比增长 177%,首个全国产 10 万卡 AI 超集群正式投用,从芯片到散热核心软硬件全部国产。生成式 AI 用户规模突破 7 亿,普及率超过 50%。去年同期还是 5.15 亿、36.5%。

硬件这一关,基本过了。上下半场的分界很清楚:上半场拼"有没有卡",下半场拼"好不好用"。而好不好用这件事,九成是软件栈的事,剩下一成才轮到硅片。

DeepSeek 这一手,等于用一家头部模型公司的工程信用,给昇腾的软件栈做了背书。它对行业的影响,是把一道原本要每家自己做的适配题,变成了可复用的公共品。多一组开源仓库只是表象。后面再有人要迁模型,起点不再是"从零啃算子",而是"改改接口跑起来"。

不过得泼点冷水。这些组件是在昇腾 950 系列上验证的,更早的 910B 等型号未必直接受益。高层语言加上运行时编译(JIT)用多了,调试链路也会更复杂。开源只是把门槛从"能不能"降到"怎么调",真正的规模化还得看社区后面能不能把坑填平。这件事的分量在开局,不在终局。

四、放回更大的局里看

我平时做的是品牌在 AI 时代的可见度,所以特别在意一件事:这类基础设施级的动作,不会只影响它自己那一层。

打个比方。软件栈的护城河一松,受影响的从来不只是芯片。编译器松了,模型团队才敢迁;模型团队迁了,推理成本才会降;推理成本降了,上层那些依赖大模型跑批量的应用才可能真正上规模,比如内容生成、社媒自动化,再比如 AI 搜索。

这和当年云计算的路径很像。有一朵云本身不值钱,值钱的是云之后长出了整个 SaaS 层。国产算力软件栈补齐之后,长出来的会是"用得起、跑得动"的 AI 应用层。我们做的生意,恰好落在这一层里。

五、该怎么应对:两个层面的判断

分两种人来说。

如果你在做技术选型。这次开源给国产栈开了一个明确的试点窗口。我的建议是先挑推理链路里最成熟的算子做小范围验证,也就是 DeepEP、DeepGEMM 这些接口已经和 NVIDIA 对齐的部分,迁移成本最低。别一上来就全量迁训练,那个周期和风险,现在还没到能拍胸脯承诺的时候。

如果你在做品牌营销。这件事对你能感知到的变化,是 AI 搜索里的答案质量会加速提升。当推理越来越便宜,像豆包和 DeepSeek、千问这些 AI 助手,能处理的问题会越来越复杂,用户拿它们做选品、比价,或者查机构的口碑,比例会继续往上走。这带来一个新现实:品牌在 AI 答案里有没有被提到、被怎么提,正在变成和搜索排名一样重要的曝光位。

这也是我们做声量 Shengliang 的出发点。我们把品牌内容在全网的分布、被 AI 引用的情况,以及社媒矩阵的运营,放进同一套系统里看。一边通过 GEO 优化(生成式引擎优化)让品牌内容更容易被 AI 抽取和引用,一边用社媒智能体把内容的生产和分发自动化,再通过 AI 可见度监测,7×24 追踪品牌在各个 AI 平台被推荐的实际情况。门槛降下来之后,真正拉开差距的,是谁先把"被 AI 看见"这件事变成一套可衡量的日常动作。

写在这波热度之后

回到 DeepSeek 这次开源。让我停下来的是 README 里的一句话:用同一个包名,让用户沿用原来的开发流程。一个模型团队愿意让国产芯片"无缝替换"得这么自然,这比任何发布会上的口号都实在。

组件开源是今天的事,用户习惯的迁移是接下来一两年的事。早动手的团队,拿到的不只是更低的成本,是一个更早被 AI 记住的窗口。

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐