华为昇腾960超节点发布:国产AI算力的比拼点正在换位置
9月17日,华为全联接大会2026在上海开幕。华为轮值董事长汪涛在主题演讲中发布了被称为"全球首个采用NPO技术的超节点"——昇腾960超节点,同时推出配套的NPO光引擎Hi-ONE。信息不算少,但对做开发的人来说,真正值得看的不是那些大数字,而是它想解决的是什么问题、以及这套东西和我们写代码、跑模型有什么关系。
这次到底发布了什么
先把事实摆清楚,据报道:
- 昇腾960超节点:基于"灵衢+Hi-ONE"打造,采用正交架构和全液冷设计,通过灵衢实现内存统一编址,可扩展至 4096 卡规模,实现 8 EFLOPS FP8、16 EFLOPS FP4 算力。
-
- Hi-ONE 光引擎:官方称是业界首个量产的 NPO(近封装光学)产品,总容量 7.2T,内置光源。用 5500 个 Hi-ONE 替代原本需要的 4.8 万颗 800G 光模块,功耗降低超 550 千瓦,系统无故障运行时间提升一倍,系统可用度 99.8%。
-
- 集群规模:多个昇腾960超节点可通过灵衢网络或 RoCE 连接,最大集群规模可达 51.2 万卡,结合多轨道拓扑技术称最大可支持 100 万卡集群。
-
- 生态:CANN 已全面开源开放,进入常态化社区运营;昇腾覆盖 PyTorch、Triton、vLLM、veRL 等 90 多个主流三方社区,据报道基于昇腾+CANN 的原生训练模型已超过 40 个。
另外官方还提到,昇腾960DT芯片计划 2027 年一季度发布,比原计划提前了三个季度。
- 生态:CANN 已全面开源开放,进入常态化社区运营;昇腾覆盖 PyTorch、Triton、vLLM、veRL 等 90 多个主流三方社区,据报道基于昇腾+CANN 的原生训练模型已超过 40 个。
技术本质:从"单卡多强"到"一张网多大"
我做了几年企业软件,对这种发布会最大的感受是:算力竞争的计分方式变了。
以前比的是单卡指标。 一颗芯片多少 FLOPS、多少显存、功耗多高,谁的卡强谁就赢。这套叙事大家都熟。
现在比的是系统级互联。 大模型训练到了十万亿参数级别,一张卡再强也放不下一个模型,必须把几千、几万张卡当成一台机器来用。这时候瓶颈就从"单卡算力"转移到了卡与卡之间的通信带宽和延迟上——同步一次梯度、交换一次激活值,网络慢一点,几千张卡就一起空转等数据。
昇腾960超节点做的事情,本质就是这三件:
- 把规模做上去:单超节点 4096 卡,最大 100 万卡集群,让小模型时代"一台服务器"的概念变成"一个机房是一台计算机"。
-
- 把互联做轻:用内存统一编址 + 全光互联(灵衢),让跨物理服务器的内存访问看起来像本地访问。这就是"超节点"这个词的核心含义。
-
- 把互联做省:4.8 万颗 800G 光模块换成 5500 个 NPO 光引擎,功耗和故障点同时下降。光模块是这类集群里最贵、最耗电、也最容易坏的部件之一,把它做少,工程意义很大。
没变的是什么? 大模型训练依然是"带宽和稳定性"的游戏。参数规模往上走,对互联的要求只会更苛刻,不会更松。所以看懂这类发布,看的不该是"多少 E"的算力,而是互联架构、组网规模、可用度这几个指标。
- 把互联做省:4.8 万颗 800G 光模块换成 5500 个 NPO 光引擎,功耗和故障点同时下降。光模块是这类集群里最贵、最耗电、也最容易坏的部件之一,把它做少,工程意义很大。
对普通开发者和从业者意味着什么
说实话,百万卡集群和绝大多数人无关。但它往下传导的几件事,和你是有关系的。
一是模型服务端的适配。 如果你是做推理部署的,vLLM、Triton 这些框架已经在昇腾生态里铺开。昇腾侧有一套和 nvidia-smi 对应的工具,查看设备和拓扑用:
# 查看昇腾设备状态(对应 nvidia-smi 的角色)
npu-smi info
二是工具链的版本坑。 国产算力落地,最容易出问题的往往不是"能不能跑",而是算子支持不齐、精度对不齐、CANN/框架版本不匹配。据公开信息,昇腾侧已有量化感知训练和自动精度校准工具,可以降低从 PyTorch/TensorFlow 迁移时的重训成本,但这不等于"零改动"。真要迁移,建议的顺序是:
- 先在小规模、非核心模型上跑通全流程;
-
- 逐层核对算子支持情况和数值精度差异;
-
- 把版本组合(CANN + 框架 + 推理引擎)固化成镜像,别在裸环境里手搓。
三是选型的思路。 别只看纸面算力。同样的模型,能不能稳定跑一整周、出问题好不好定位、出问题时社区有没有人回你——这些比峰值数字更影响你的工期。生态"开源开放"这件事的价值,恰恰在这里:出问题时有源码可查、有社区可问。
- 把版本组合(CANN + 框架 + 推理引擎)固化成镜像,别在裸环境里手搓。
结尾
昇腾960这次把重点放在互联和组网规模上,方向是清楚的:大模型时代的算力竞争,已经从"谁的卡强"变成"谁的网大、谁的网稳"。对普通开发者来说,这波浪潮最实际的影响,是未来做推理部署时,服务器上躺着的可能不再是清一色的英伟达卡。
你所在的项目,有没有开始接触国产算力?迁移过程中最头疼的是什么?评论区聊聊。
更多推荐




所有评论(0)