摘要

2026 年 9 月 17 日,华为全联接大会 2026 在上海启幕,轮值董事长汪涛发布昇腾 960 超节点——全球首个采用近封装光学(NPO)技术的 AI 超节点,并披露昇腾 960DT/960PR 芯片路线。单超节点可互联 4096 张 NPU、提供 8 EFLOPS FP8 算力与 1PB HBM,依托灵衢 UnifiedBus 最高可扩展至百万卡集群。本文从芯片、光互联、统一总线与集群拓扑四个层面,拆解这套"硅基黑土地"如何支撑十万亿级大模型。

一句话结论:昇腾 960 的核心不在单卡性能,而在于用 NPO 光互联 + 灵衢统一协议把数千张芯片"当成一台逻辑机器来用"——这是中国算力底座第一次在系统架构层面,给出有别于 NVLink/InfiniBand 的规模化替代路径。


1. 事件全景:一场"提前三个季度"的算力宣言

1.1 发布要点

项内容来源
时间/地点2026-09-17,华为全联接大会 2026,上海华为 / 网易 / 头条
主讲轮值董事长汪涛《智启新未来,打造智能世界的硅基黑土地》网易
芯片昇腾 960DT(训练)/ 960PR(推理),性能翻倍、上市提前华为
超节点全球首个量产 NPO 光引擎 Hi-ONE + 灵衢 UnifiedBus华为
集群二层 CLOS 四平面 → 51.2 万卡;多轨道拓扑 → 100 万卡头条 / 网易

汪涛强调,面对大模型迈向十万亿规模的趋势,超节点已成为超大规模 AI 基础设施的必然方向,华为坚持"超节点 + 集群"路线,靠系统架构创新构筑算力竞争力。


2. 芯片层:960DT 与 960PR 的双线节奏

2.1 核心参数

型号定位FP8 算力FP4 算力HBM访存带宽单卡互联就绪时间
960DT训练2 PFLOPS4 PFLOPS288 GB9.6 TB/s2.2 TB/s2027 Q1(提前 3 季度)
960PR推理2 PFLOPS8 PFLOPS288 GB9.6 TB/s2.2 TB/s2027 Q3(提前 1 季度)

单卡集成 288 GB HBM、9.6 TB/s 访存带宽、2.2 TB/s 互联带宽,数据高速流转不必卡在内存墙。

2.2 一年一代的演进节奏

华为确立了"τ 定律"创新方向,坚持一年一代:

  • 2027:昇腾 960(DT/PR)
  • 2028:昇腾 970
  • 2029:昇腾 980

每一代在算力规格、访存带宽/容量、互联带宽上同步翻倍,靠架构创新弥补制程短板。


3. 光互联层:Hi-ONE 与 NPO 的功耗革命

3.1 为什么是 NPO

传统可插拔光模块电信号路径长,功耗与延迟偏高。**近封装光学(NPO)**把光学引擎直接靠近芯片封装,缩短电信号行程。华为自研 Hi-ONE 引擎:

指标数值
单引擎传输容量7.2 T(已知最大传输能力的 NPO 产品)
独特性业内唯一内置光源的量产 NPO
单超节点用量约 5500 个
替代对象原本需约 4.8 万颗 800G 光模块
功耗节省超 550 千瓦
无故障运行提升一倍(可用度 99.8%)

对大规模训练而言,可用度每提升 0.1 个百分点,全年中断时间就显著减少——光互联的可靠性直接转化为有效算力利用率。

3.2 标准化意图

华为在 OIF(全球光互联标准组织)提出 NPO 标准立项建议,试图把产品能力转化为产业生态,避免"自娱自乐"。


4. 总线层:灵衢 UnifiedBus 统一协议

4.1 一套协议平等连接一切

**灵衢(UnifiedBus)**让处理器、内存、存储与网络共享统一协议,支持跨机柜高速光连接,减少协议转换开销。超节点可同时连接约 4000 颗处理器,多个超节点再组成超集群,理论上扩展到百万卡。

4.2 配套套片与存储

围绕训练/推理系统,华为还发布:

  • 11 颗系列化套片:覆盖计算、互联、存储、管理等关键能力;
  • 鲲鹏超节点升级:灵衢全光组网,最大 4096 节点,256 TB 统一内存池;Agent 沙箱场景十万级沙箱启动提速 30 倍、密度再升 25%;
  • OceanStor M900:面向 Agent 推理的 L3.5 层 PB 级 KV 缓存集群,灵衢"一跳直连",混合介质 + Retention 优化使 SSD 读写寿命提升 16 倍。

5. 集群层:从 4096 卡到百万卡的拓扑数学

5.1 规模台阶

层级规模关键支撑
单超节点4096 卡 / 8 EFLOPS FP8 / 1 PB HBMHi-ONE + 灵衢
超集群51.2 万卡二层 CLOS 四平面组网
极限扩展100 万卡多轨道拓扑技术
规划 SuperPoD15,488 芯 / 220 机柜 / 约 2200 ㎡训练推理性能 3–4× 前代

5.2 集群规模计算的示意

# ascend_cluster_math.py — 超节点到百万卡集群的扩展性估算(示意)
NPU_PER_SUPERPOD = 4096          # 单超节点 NPU 数
SUPERPODS_CLOS   = 125           # 二层 CLOS 四平面可组超节点数
SUPERPODS_RAIL   = 244           # 多轨道拓扑可组超节点数

# 二层 CLOS 四平面:约 51.2 万卡
cluster_clos = NPU_PER_SUPERPOD * SUPERPODS_CLOS
# 多轨道拓扑:约 100 万卡
cluster_rail = NPU_PER_SUPERPOD * SUPERPODS_RAIL

print(f"CLOS 组网规模 ≈ {cluster_clos/1e4:.1f} 万卡")
print(f"多轨道拓扑规模 ≈ {cluster_rail/1e4:.0f} 万卡")

# 单超节点可用度
availability = 0.998
downtime_hours_per_year = (1 - availability) * 24 * 365
print(f"单超节点年中断 ≈ {downtime_hours_per_year:.1f} 小时")

把多台物理机器"变成一台逻辑计算机",正是超节点架构对抗通信开销与故障率的核心思路,也是十万亿参数模型有效训练的 prerequisit。


6. 生态层:从"可用"到"易用"的拐点

指标数值来源
CANN 社区外部开发者占比61%(首次超内部)腾讯研究院速递
鲲鹏生态全球开发者超 416 万腾讯研究院速递
已交付超节点1000+ 套头条
覆盖客户370+ 家头条
Atlas 950 超节点已进入规模商用头条

汪涛称 CANN 已全面开源开放、进入常态化社区运营,昇腾生态跨越从"可用"迈向"易用"的关键拐点,支持主流大模型在昇腾平台原生训练。


7. 意义:国产算力的系统级替代

  1. 架构独立性:NPO + 灵衢给出不同于 NVLink/InfiniBand 的规模化路线,降低对单一海外互联方案的依赖。
  2. 十万亿级支撑:单超节点 1 PB HBM 与百万卡扩展能力,直接面向下一代超大模型训练/推理。
  3. 可靠性即算力:99.8% 可用度与功耗下降,把"省下的电费与中断时间"转化为有效算力。
  4. 生态正循环:外部开发者过半 + 千套交付,意味着软件栈与国产模型适配进入自增强阶段。

8. 常见问题(FAQ)

Q1:昇腾 960 单卡算力相比上代提升多少?
A:官方称性能"翻倍",960DT 提供 2 PFLOPS FP8 / 4 PFLOPS FP4,960PR 推理 FP4 达 8 PFLOPS;且上市时间较原计划提前 1–3 个季度。

Q2:NPO 和传统的可插拔光模块有什么不同?
A:NPO 把光学引擎靠近芯片封装,缩短电信号路径,降低功耗与延迟;Hi-ONE 单引擎 7.2T、内置光源,5500 个即可替代 4.8 万颗 800G 模块,省电超 550 千瓦。

Q3:百万卡集群怎么实现?
A:基于灵衢 UnifiedBus 统一协议,先用二层 CLOS 四平面组网到 51.2 万卡,再叠加多轨道拓扑技术扩展到 100 万卡昇腾超节点集群。

Q4:和 NVLink/InfiniBand 路线有何区别?
A:昇腾走"超节点 + 灵衢统一总线 + NPO 光互联"的系统架构路线,强调把数千芯当一台逻辑机器;NV 系依赖 NVLink 域与 InfiniBand 横向扩展,两者在拓扑与协议栈上并行存在。

Q5:开发者现在能用吗?
A:芯片 2027 年起就绪,但 CANN 已开源、Atlas 950 超节点规模商用,现有生态可先基于上一代平台开发适配。

Q6:对国产大模型训练意味着什么?
A:更强的单超节点 HBM 与互联,叠加百万卡扩展,意味着十万亿参数模型的国产原生训练具备更完整的底座支撑。


9. 参考资料

  • 华为全联接大会 2026 主题演讲(汪涛),上海,2026-09-17
  • 网易:《全球首个采用 NPO 技术 华为轮值董事长汪涛:昇腾 960 芯片将提前发布,并实现性能翻番》,2026-09-17
  • 今日头条:《昇腾 960 提前就绪:华为全联接大会释放算力产业重塑信号》,2026-09-18
  • 今日头条:《华为昇腾 960 超节点亮相,NPO 光互联带来新变化》,2026-09-18
  • 腾讯研究院 AI 速递 20260918

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐