null中国移动 9 月底发布《2026 年至 2027 年新一代人工智能超节点设备集中采购项目》招标公告。https://mp.weixin.qq.com/s/cr-GEZ3CTqrtm7onExmQ-w

AI超节点技术展望:技术演进、产业洞察和极限算力普惠

Nvidia为例 DPU的Multi-Host、Socket Direct 、GPUDirect、RDMA 技术点分析

Agentic AI时代的处理器算力需求和Nvidia、ARM、AMD等大厂的回答

Atlas 950 SuperPoD 超节点白皮书解读

AI超节点Scale Up域总线各层优化设计

Atlas 950 1024卡SuperPoD推测分析

谈谈智能网卡和DPU

NVIDIA-GB NVL72 超节点分析

Atlas 900 A3 SuperPoD 384超节点互联逻辑浅析

中国移动 9 月底发布《2026 年至 2027 年新一代人工智能超节点设备集中采购项目》招标公告。依据招标前发布的「采购意见征求公告」,本文汇总三个征求意见包(超节点、智算存储、分布式文件存储)共 14 份原始技术文件,提炼为成本文。全文约 5000 字,读完约 12 分钟,建议先收藏。

阅读提示
文中所有数值均来自公开的公示版规范书,投标以正式招标文件(需登录购买)为准。
标注「★」的条款不满足直接废标。

一、项目速览

招标编号

CMCC20260500251

标包

不划分,选 4–5 家中标人

投标窗口

约 27 天

采购清单(四行,共 4 类设备)

产品

单位

数量

人工智能超节点设备

卡

20,480

无损以太网交换机(RoCE)

台

448

智算存储

套

72

分布式文件存储

套

10

三条硬门槛
1. 只接受超节点设备制造商投标,不接受代理商、不接受联合体
2. 每个典配最小承诺供货量 ≥ 总规模 30%
3. ★ 条款不满足即废标

二、超节点设备

1. 配置模型共 15 档

液冷组按整机柜交付,三个系列的区别只在 AI 卡与显存:SPT1 = 547T/144G、SPT2 = 547T/96G、SPT3 = 425T/96G。

卡数

配置模型

单元配置

1024

SPT1/2/3-1024

计算单元 ×16 + SPL-L2 ×4

512

SPT1/2/3-512

计算单元 ×8 + SPL-L2 ×2

256

SPT1/2/3-256

计算单元 ×4 + SPL-L2 ×1

64

SPT1/2/3-64

计算单元 ×1

单柜怎么装出一个 1024 卡
21 英寸标准机柜内:8 个计算节点(每节点 8 卡)+ 4 个 ScaleUp 交换节点。计算单元型号 SPL-547-144 / SPL-547-96 / SPL-425-96 即对应上述三个系列。

风冷组按单节点交付,只有 425T/96G 一个系列(SPA-425-96):

卡数

模型

单元与光模块

96

SPT4-96

×12 + SP-L2 ×4,800G 光模块 768 个 / 光纤 384 根

64

SPT4-64

×8 + ×3,384 个 / 192 根

32

SPT4-32

×4 + ×1,192 个 / 96 根

2. 计算节点核心配置

CPU

Kunpeng950 7590 或同等及以上能力平台,×2
96 核、2.3GHz、L3 273MB、TDP 440W
浮点整型运算性能 ≥ 1000

内存

DDR5、ECC RDIMM、6400MT/s,24 条
SPT1 为 96GB×24,其余为 64GB×24

系统盘

480GB 企业级 SATA SSD ×2,RAID0,1

数据盘

7.68T U.2 NVMe PCIe5.0 ×2
风冷节点为 3.84T 或 7.68T,×4

AI 卡

昇腾950

(547T / 425T),显存 144GB / 96GB,×8

卡间互联

双向 1008 GB/s
风冷 32 / 64 卡为 784 GB/s

散热

CPU 与 AI 卡液冷,液冷散热占比 ≥70%,其余风冷

3. 机柜与供电

21 英寸标准机柜|宽 600mm|高 ≤2300mm|深 ≤1450mm|满配 ≤1700kg
集中式电源框 PowerShelf:单框 36kW,三相 380V AC,4 线输入 A/B 路冗余
柜内电源模块 N+M(2≤M≤N),插槽全部配满
50% 负载电源转换效率 ≥96%(80Plus 钛金或 CQC V 级)
集中式 CDU 液冷,Manifold 接口在机柜底部

4. 网络接口组(三套方案均须支持)

方案1 · 标卡

带内管理 2×10GE|业务 2×25GE|高性能存储 2×100GE 或 200GE(RoCEv2)|ScaleOut 1×800GE OSFP ×4 或 ×2

方案2 · 磐石DPU

DPU 2×100GE 磐石DPU|ScaleOut 1×800GE ×4 或 ×2

方案3 · DPU+数据面

存储 2×100GE / 2×200GE RoCEv2|DPU 2×100GE|ScaleOut 1×800GE

风冷节点另有 ScaleUp 接口 1×800GE OSFP ×32,ScaleOut 换为 2×400GE ×4。所有光模块均为多模(850nm)。

5. 写死的硬指标

对全部 AI 卡内存全局统一编址,任一计算单元可用内存语义直接访问其他 AI 卡内存
10℃–35℃ 进风口温度长时间稳定运行;湿度 10%–85%
支持 BC-Linux 及自主可控操作系统
交换芯片转发 1024Byte Payload 时总线带宽利用率理论值 ≥85%

硬盘性能门限(评分项,精确到小数):

盘

4K 随机读

4K 随机写

SATA 480G

≥76,377

≥33,329

NVMe 3.84T

≥2,459,811

≥293,632

NVMe 7.68T

≥2,553,732

≥384,045

单位为稳态 IOPS 均值(±5% 区间内一致性 ≥79%)。顺序带宽:SATA 128K 读 ≥427.6 / 写 ≥394.3 MB/s;NVMe 128K 读 ≥10.8 GB/s、写 ≥5.0~7.4 GB/s;4K 随机读时延 ≤67.5 微秒。

6. 评分表 100 分怎么分

推理性能(5 模型 × 6 场景,30 项)

30

Wan2.2 模型推理

2

训练性能(6 模型,各 2.5 分)

15

硬盘性能

4

网络点通信(节点内 / 节点间)

4

网络集合通信(6 种原语)

6

功能测试 / 整机功耗

1 / 2

供应链能力 / 生态认证

6 / 6

ITSS / 绿色工厂 / 内存安全

5 / 3 / 2

技术方案(模型调优 + 液冷整机柜交付)

6

供应链生态及安全机制

4

技术规范书应答

4

合计

100

读法:性能大类合计 47 分,是最重的板块;供应链与生态类(供应能力+生态认证+ITSS+绿色工厂)合计 20 分——说明本项目比的不是单纯参数,而是"加速卡原厂生态等级 + 实际出货体量"。供应能力要求提供加速卡原厂开具的发票,出货 80 亿元以上才得满分。

三、交换机

本次招标的"交换机"其实涉及两张网:机柜内的 ScaleUp 网(AI 卡互联,随超节点配套)和跨超节点的 ScaleOut 网(RoCE,448 台)。前者有完整公开规格,后者没有。

1. ScaleUp 一层交换节点(柜内,液冷)

总带宽

76.8 T

上行

32 × 800GE,OSFP,光互联

下行

128 × 400GE,电互联

光模块

64 个多模 800GbE、OSFP、MPO、850nm、VR8、50m 光模块
+ 配套光纤 32 根

散热

交换芯片冷板液冷,液冷占比 ≥60%

2. ScaleUp 二层交换机

项目

液冷型 SPL-L2

风冷型 SP-L2

总带宽

102.4 T

76.8 T

下行

128 × 800GE

96 × 800GE

形态

单柜 4 台,5U

19 英寸,4U

散热

交换芯片液冷

风冷

3. 交换芯片要求(一层二层通用)

无损流控:拥塞不丢包,至少支持 PFC 或 CBFC / BFC 之一
转发机制:支持基于 GPU ID 或 EID 的互联转发
转发性能:支持下 1024Byte Payload 带宽利用率理论值 ≥85%
可靠性:支持点到点重传

4. ScaleOut 的 RoCE 交换机(448 台)——规格未公开

超节点项目里的 448 台 RoCE 交换机走的是跨超节点参数面。按《交付技术要求》,这条网络由超节点设备供货商牵头,RoCE 网络厂商配合。但本项目三个公开征求意见包里都没有它的独立技术规范书,规格应在需登录购买的招标文件中。

可参照的官方口径是 2026 年 2 月单独立项的集团级 RoCE 集采(招标编号 CMCC20260500027,1790 台,限价合计约 9.97 亿元):

标包

规格

台

1 通用

51.2T 盒式组合

380

2 自主可控

400G 框式组合

360

3 自主可控

12.8T 盒式组合

210

4 自主可控

12.8T + 25G 盒式组合

360

5 通用

51.2T 白盒组合

100

6 自主可控

51.2T 盒式组合

380

自主可控标包合计 1310 台,占 73.18%。只接受制造商投标、不接受代理商与联合体,送检产品需通过同质化判定。
2026 年 6 月中标结果:总额 8.8 亿元——华为 4.24 亿、锐捷 1.47 亿、中兴 1.46 亿、新华三 1.42 亿。

四、智算存储(72 套)

面向万卡 / 十万卡智算中心,承接训练集加载、checkpoint 读写、KV Cache、RAG 数据与推理日志。两个典配:

项目

典配1 高端

典配2 中端

有效容量 ★

≥500 TB

≥250 TB

系统功耗

<12 kW

<8 kW

单节点并发

>2000

>1000

单节点内存 ★

≥256 GB

≥256 GB

仅存储节点主存 SSD 计入有效容量,单盘 ≤15.36TB、盘数 ≤64、DWPD ≥1。

性能指标

典配1

典配2

NFS 顺序读

≥90 GB/s

≥45 GB/s

POSIX 顺序读

≥180 GB/s

≥90 GB/s

NFS 顺序写

≥50 GB/s

≥25 GB/s

系统 OPS(NFS)

≥45 万

≥25 万

对象吞吐 4MB

≥15 GB/s

≥7.5 GB/s

三个值得注意的功能要求
1. 存储与 AI 加速器直通(要求实配)——不经过主机 CPU,直接从存储拷到 AI 卡显存;明确点名兼容昇腾、沐曦、壁仞
2. KV Cache 存储(多项 ★)——KV Cache 动态卸载至外置存储并按索引复用,含生命周期、多模型隔离、多节点一致性、多级缓存;兼容 vLLM / SGLang / MindIE
3. 向量数据库(可选)——向量相似性搜索下推到存储层,张量切片与 RAG 图谱原生访问

冗余要求:3 副本,或 EC N+M(N ≤14、M ≥2);元数据切换 <10s;故障后 1TB 重构 <30 分钟。

五、分布式文件存储(10 套)

文件+对象融合一体机,面向归档与分级存储。两个典配,且容量型只认 HDD 计入有效容量:

项目

典配1 容量型

典配2 性能型

有效容量 ★

≥1 PB

≥1 PB

系统功耗

<8 kW

<12 kW

单节点内存

≥64 GB

≥128 GB

NFS 吞吐

>4 GB/s

>12 GB/s

系统 OPS

>3 万

>12.75 万

对象吞吐 4MB

≥7.5 GB/s

≥10 GB/s

可靠性明显更宽松:3 副本或 EC N ≤8、M ≥2,允许4 块盘 / 4 个节点同时故障(须在不同节点),1TB 重构 <1 小时。

接口(★):文件 NFS / CIFS / FTP / POSIX,对象 S3 V2 与 V4
必须支持 IPv4 / IPv6 双栈、单一命名空间、多协议同时共享、CSI 对接 K8S、WORM、防病毒扫描
OpenStack 对接:一套存储须对接多套 OpenStack;一套 OpenStack 须对接 ≥5 套不同命名空间的存储,且单集群故障不影响其他集群

六、一句话看懂四类设备

超节点设备

把 1024 张卡用内存语义连成一台机器

ScaleUp 交换机

柜内 / 柜间 AI 卡的无损互联通道

智算存储

训练提速用:全闪、低时延、直通显存、扛 KV Cache

分布式文件存储

归档存放用:HDD 计容、文件对象融合、吞吐低一个量级

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐