2026年9月17日,华为全联接大会上海启幕。汪涛在主题演讲中发布了全球首个采用NPO技术的超节点——昇腾960超节点。单个超节点最大支持4096卡,8E FP8算力,1PB HBM容量,可加速十万亿规模大模型的训练与推理。

这条消息在技术社区炸了锅。但热闹之余,一个问题值得每个AI基础设施从业者深思:当模型参数从千亿走向十万亿,我们现有的算力架构还撑得住吗?

一、十万亿参数时代,算力架构撞上了三堵墙

2026年9月的大模型排行榜刚更新,前排选手的上下文窗口已经普遍突破100万token——Muse Spark 1.3做到104.8万,GPT-6 Astra做到105万,国产GLM-5.3更是冲到131万。模型在变大,训练它们的算力集群也在变大,从千卡到万卡再到十万卡。

但规模上去之后,三堵墙横在面前:

第一堵墙:通信开销吃掉算力收益。 集群规模越大,卡与卡之间的通信代价越高。传统RoCE组网下,跨节点数据传输要经过多层交换机,延迟随跳数线性增长。4万张卡组成的集群里,大量时间花在等数据到达上,GPU利用率可能不到50%。一位在头部大厂做分布式训练的工程师直言:"扩到万卡以后,加卡的边际收益已经很不明显了,通信开销吃掉了一大半。"

第二堵墙:光模块成本和功耗爆炸。 传统组网依赖大量800G光模块。一个大规模集群动辄需要数万颗光模块,单颗功耗不低,散热压力巨大。光模块本身的采购成本加上配套的散热、供电改造,让十万卡集群的TCO(总拥有成本)高到令人咋舌。有测算显示,光模块相关支出可占集群总成本的20%-30%。

第三堵墙:系统可用度随规模下降。 集群越大,单点故障概率越高。一张卡故障可能导致整个训练任务中断重启,checkpoint恢复动辄耗时数小时。在十万卡规模下,系统无故障运行时间(MTBF)成为制约训练效率的隐形瓶颈——你不是在训练模型,你是在和硬件故障赛跑。

这三堵墙的根源是同一个问题:传统集群架构把"多台服务器"当作"多台服务器"来用,而不是当作"一台计算机"来用。 节点间的内存不共享,通信走网络协议栈,故障隔离靠应用层重试。当规模到万卡以上,这套架构的局限性就暴露无遗。

二、NPO超节点:让4096卡共享一个内存地址空间

华为给出的答案是超节点架构——不是把更多卡连在一起,而是让它们"像一台计算机一样协同工作"。

昇腾960超节点的核心技术创新有三层:

第一层:NPO(近封装光学)技术。 这是本次发布最硬核的突破。NPO把光引擎从交换机侧搬到芯片封装附近,缩短光路距离,实现极高带宽极低延迟的片间互联。华为自研的Hi-ONE光引擎是业界首个量产NPO产品,单引擎传输容量7.2T,也是唯一实现内置光源的NPO产品。用5500个Hi-ONE替代了原本需要的48000颗800G光模块——光模块数量减少88%,功耗降低超550千瓦,系统无故障运行时间提升一倍,可用度达到99.8%。

第二层:灵衢互联协议。 灵衢实现内存统一编址,4096张卡的显存组成一个1PB的统一内存池。对上层应用来说,数据在哪张卡上无所谓——地址空间是连续的,跨卡访问走硬件总线而非网络协议栈。这意味着分布式训练中的AllReduce、AllGather等集合通信操作不再需要走网络,延迟从毫秒级降到微秒级(RTT低至2μs)。

第三层:正交架构+全液冷设计。 正交架构简化了信号路径,全液冷解决高密度散热问题。从工程角度看,这是让4096卡规模从"理论可行"变成"稳定可运行"的关键。

三层叠加的效果是:单个超节点4096卡,8E FP8算力,16E FP4算力,1PB HBM容量。多个超节点通过灵衢网络或RoCE连接,最大集群规模51.2万卡;结合多轨道拓扑技术,最大支持100万卡昇腾超节点集群。

从"多台服务器"到"一台计算机"——这是架构范式的转变,不是渐进改良。

三、自建集群 vs 华为云超节点:三笔账算清楚

很多团队的第一反应是:"我自己买卡搭集群不就行了?"——可以,但请算清三笔账。

维度自建万卡集群华为云昇腾960超节点
初始投入4万颗800G光模块+交换机+散热改造,光互联成本占比20-30%5500个Hi-ONE替代48000颗光模块,光互联成本降88%
通信效率RoCE多层交换,跨节点延迟毫秒级,GPU利用率<50%灵衢统一编址,RTT 2μs,GPU利用率显著提升
系统可用度万卡规模MTBF下降,故障恢复耗时数小时可用度99.8%,MTBF提升一倍,液冷设计降低故障率
扩展上限单集群万卡级,再扩需重构组网单超节点4096卡,集群最大100万卡
运维成本需专职团队维护硬件+网络+散热,人力成本高华为云全托管,CANN全面开源,从"可用"到"易用"
模型适配需自行适配CANN/MindSpore,踩坑周期长昇腾原生支持主流大模型,百模千态即插即用

时间账: 自建一个万卡集群,从采购到调试到稳定运行,保守6-12个月。这期间模型在迭代,竞品在发布,算力闲置每一天都是真金白银的浪费。

试错账: 大规模集群的坑不是看文档能预见的。光模块批次兼容性、液冷管路布局、CANN版本与模型适配、故障隔离策略——每个坑都要真踩过才知道深浅。华为在超节点上已经踩完了这些坑,CANN全面开源进入常态化社区运营,昇腾生态已跨越关键拐点。

机会成本账: 当十万亿参数模型成为新的baseline,你的竞争对手已经在超节点上跑训练了,你还在调试光模块。算力基础设施的代际差距,会直接转化为模型迭代速度的差距。

四、华为云全栈:从算力底座到模型服务的闭环

昇腾960超节点不是孤立的产品,它站在华为云AI全栈的最底层:

昇腾960超节点(算力底座)
    ↑
ModelArts Studio(模型训练+推理服务+智能体编排)
    ↑
盘古大模型(行业预训练模型:openPangu-2.0-Pro 505B等)
    ↑
MaaS模型即服务(160+模型在线调用,含主流开源+盘古系列)
    ↑
AgentArts(企业级智能体开发平台,下半年发布)

这个全栈的价值在于:你不需要从零搭建每一层。 算力用昇腾960超节点,训练用ModelArts Studio,模型用盘古或MaaS上160+模型,智能体用AgentArts编排。每一层都经过华为的工程验证,层间接口标准化,不存在"组装兼容性"问题。

一个实际场景:某金融企业要训练一个行业大模型,参数规模500B。如果自建,需要采购GPU服务器、配置InfiniBand网络、部署训练框架、适配模型代码、搭建监控运维——至少3个月起步。如果用华为云全栈,在ModelArts Studio上选择昇腾960资源池,拉起盘古基座模型做增量训练,MaaS上部署推理服务——从数据准备到模型上线,周期可以压缩到2-3周。

五、三步走:从评估到落地的实操建议

第一步:算力需求评估。 梳理模型参数规模和训练数据量。百亿到千亿参数级当前万卡集群勉强够用;向万亿以上演进,超节点架构是必须提前布局的近忧。

第二步:全栈 vs 自建选型。 评估团队是否具备大规模集群运维能力。没有专职基础设施团队,华为云全托管超节点是更务实的选择。CANN已全面开源,不存在闭源锁定风险。

第三步:从小规模验证开始。 先在ModelArts上申请昇腾资源池做小规模验证,确认CANN/MindSpore兼容性,再逐步扩规模。按需计费,验证成本可控。

写在最后

昇腾960超节点的发布标志着一个转折点:算力基础设施从"堆卡"进入"系统级创新"阶段。 NPO技术、灵衢互联、统一内存编址——这些不是营销概念,是实实在在解决十万卡规模下通信、功耗、可用度三大瓶颈的工程突破。

CANN全面开源,昇腾960明年陆续上市,970定档2028年——一年一代的演进节奏已经明确。对于正在规划AI基础设施的技术团队,现在正是评估超节点架构的窗口期。

算力是AI的引擎。引擎换代的时候,提前坐上新车的人,跑得最快。

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐