9月30日,DeepSeek宣布开源面向华为昇腾算力平台的全套基础设施组件,涵盖TileLang高级语言编译工具、计算库和分布式通信库。据报道,这批组件与其此前面向英伟达平台开源的组件"一一对应"。说白了,就是DeepSeek把在英伟达生态里跑大模型用的那套底层工具,照做了一份昇腾版本,并把接口对齐。

对不搞底层的人来说,"开源几个库"听起来没什么。但这件事的分量,得放在AI算力的软件栈这个语境里看。

技术本质:算力能用几成,一半在软件

芯片的理论算力只是起点。一个模型跑起来,运算怎么拆分、数据怎么搬、计算和访存怎么衔接,都会决定硬件最终能发挥几成功力。这些活儿大部分落在"算子"实现上——而写算子,主流方式是用英伟达的CUDA。

问题就在这。全球AI行业长期依赖CUDA生态,主流大模型的训练代码多是基于CUDA写的,和英伟达硬件深度绑定。国产芯片这几年硬件指标上来了,但企业换芯片绕不开"迁移成本"这道坎:代码要重写、性能要重调、工具链要重建。

这次开源的TileLang,就是冲这道坎去的。它由北京大学计算机学院团队主导开发,2025年1月开源,定位是连接大模型算法和底层芯片的"桥梁"。据DeepSeek介绍,相比CUDA,TileLang编程更简单、代码逻辑更简洁;相比其他同类高级语言,它的编程模型又能吃满芯片特性、逼近硬件性能上限。目前DeepSeek V4系列模型训练中大部分算子,都是用TileLang实现的。

这次到底开了什么

公开信息显示,本次开源包括昇腾平台的核心计算与通信组件:

  • DeepGEMM:加速通用矩阵运算
    • DeepEP:大规模跨设备通信
    • TileKernels:常规向量计算和访存算子
    • FlashMLA:稀疏注意力算子,提升长上下文处理效率
    • DeepSelect:高效数据筛选
      TileLang昇腾版本做的是对昇腾Ascend C底层指令的封装,提供高级语言编程方式,同时不损失硬件性能。DeepSeek称,其训练中用到的每一个TileLang算子,在昇腾上都有对应的高性能实现。据报道,在多项关键测试用例中,这些组件的计算与通信性能已接近硬件上限。

硬件侧,双方还联合推进了基于昇腾950的128卡超节点方案(SuperPoD Flex、UBL128组网)。据披露,互联带宽实测达到 Dispatch 375 GB/s、Combine 347 GB/s。这算得上很硬的指标。

变了什么,没变什么

没变的是:CUDA的生态地位短期内不会被动摇,英伟达仍是默认选项,前沿模型的训练主战场也还在那边。国产软件栈补的是"多一个选择",而不是"平替"。

变的是摩擦:接口层一一对应,意味着模型团队在软件栈层面不再唯一依赖英伟达。对底层开发者来说,以前换芯片等于从零重写关键能力,现在可以复用已经实现好的基础组件,把精力更多投到自己的模型结构和应用需求上;真在某个环节卡住,还能翻开源码改实现。据DeepSeek的说法,希望这套开源工作能"对更多AI芯片建立高可用软件生态起到示范作用"。

对普通开发者和从业者的实际意义

坦白讲,这套东西离写业务代码的人比较远——你大概率不会直接调DeepEP。但它会以三种方式影响你:

  1. 算力成本:国产芯片软件生态越成熟,可用的算力供给越多,长期看推理单价有下行空间。你调API的账单,和这些底层工作间接相关。
    1. 技术栈风向:如果"不完全依赖CUDA"的生态真立起来,未来招聘和项目里出现国产芯片适配需求的概率会上升。早一点认识TileLang、CANN这类名词,不吃亏。据报道,中信证券研报预计,随着Agent及多模态应用爆发,2026年国产算力芯片出货量可能至少翻倍。
    1. 别急着迁移:手上跑得好好的英伟达方案,没必要因为一条新闻就动。迁移永远要算总账——开发时间、调试成本、性能落差,都是钱。

一句收尾

底层工具开源这件事,价值往往不是当天兑现的,而是慢慢改变"默认选项"的分布。国产算力软件栈从"能用"到"好用",还差多少个版本,值得盯着看。你怎么看这次开源,评论区聊聊。

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐