这两天在上海的华为全联接大会上,华为丢出了一个挺炸的东西——昇腾960超节点。名字听着绕口,翻译成人话就是:华为想用一套全新的连接方式,把成千上万张AI芯片拼成「一台电脑」。这事要是真成了,国产AI算力可能就要换个玩法了。

百万张卡连成一台电脑,这次真的有谱了

过去大家拼算力,都是拼单张芯片有多强。但大模型越做越大,参数从万亿级往十万亿级奔,问题就来了:一张卡再强也扛不住,得几千上万张卡一起干活。可卡一多,卡和卡之间怎么通信,就成了最大的瓶颈——以前主要靠铜缆互联,距离一长、带宽一大,信号就衰减得厉害。

华为这次换个思路,搞了个「超节点」。核心是一套叫灵衢的高速互联协议,把最多4096张昇腾960卡连在一起,内存统一编址,让它们像一台计算机一样协同工作。单节点算力达到8 EFLOPS(FP8),还配了1PB的HBM内存。更狠的是,多个超节点还能再往上连,最大能搭出100万卡的超级集群。

▲ 超节点把成千上万张卡连成一台机器

NPO是啥?说白了就是给芯片接上光纤

这次最让人眼前一亮的,是华为说的「NPO」——近封装光学。传统的大算力系统里,芯片之间主要靠铜缆传电信号,距离和带宽都受物理极限限制。华为的办法是,在算力卡边缘几厘米的地方,把电信号直接转成光信号,用光来互联。

华为自研的光引擎叫Hi-ONE,单颗传输容量7.2T,是目前行业最大的量产NPO产品,也是唯一内置光源的。一台昇腾960超节点用5500个Hi-ONE模块,就替代了原来要用的4.8万颗800G光模块,功耗还降了550千瓦以上,系统可用度干到99.8%。说白了,就是拿光缆替铜缆,既省电又更快,这是国产算力第一次在「系统级」上做出自己的东西。

▲ NPO光引擎用光缆替代铜缆互联

大厂开始用脚投票,订单真的来了

技术有没有用,市场说了算。有意思的是,这次华为的国产算力,真有人掏钱了。有消息说,DeepSeek被曝计划部署16万颗华为AI加速器;马来西亚也在考虑用华为方案建自己的主权AI。智谱那边,GLM-5.3的全部生产推理已经跑在超过10万张国产加速器上,单token成本跟英伟达GPU持平。

还有个细节挺关键:寒武纪进了PyTorch基金会当白金会员,还拿了董事会席位,昇腾也成了首个入驻PyTorch官网的中国算力平台。这意味着开发者生态这块,国产算力开始补课了——以前是「有芯片没软件」,现在软件生态也在慢慢跟上来。

▲ 国产AI芯片开始补软件生态的课

国产算力,这次换了个打法

过去大家总盯着「国产芯片能不能追上英伟达」这一道题,说实话,单芯片的差距短期很难抹平。但华为这次给了一个不同的答案:不拼单卡,拼系统。用光互联、超节点、统一内存,把一堆「不够强」的芯片捏成一台「够用的电脑」。

这条路能不能走通,还要看昇腾960明年量产后的真实表现,以及开发者到底愿不愿意把模型搬上来。但至少有一点是确定的:国产AI算力,已经从「单点追赶」迈进了「系统级创新」的阶段。这场仗,换了个打法。

#华为昇腾;#国产算力;#AI芯片;#超节点;#NPO光互联

如果国产算力真能把成本打下来,你更关心AI用起来便不便宜,还是它跑得够不够快?

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐