信创国测 AI 卡不同型号分析总结
·
结论
| 维度 | 结论 |
|---|---|
| 算力对比 | 昇腾 910 FP16 算力 (320 TFLOPS) 略超 A100 (312 TFLOPS);M890/DCU-3G/壁砺 166 ≈ A100 的 80% |
| 显存容量 | M890 (144GB) > A100 (80GB) > DCU-3G/壁砺 166 (64GB) > 昇腾 910 (32GB) |
| 带宽性能 | DCU-3G (1.6TB/s) ≈ A100 (1.9TB/s),显著高于其他国产卡 |
| CUDA 兼容 | 海光 DCU-3G 是唯一接近 CUDA 兼容的国产卡,迁移成本最低 |
| 生态成熟度 | 昇腾生态最成熟(CANN+MindSpore),但需代码迁移 |
快速选型建议
| 场景 | 首选 | 备选 | 替代效果 |
|---|---|---|---|
| 千亿大模型训练 | 真武 M890 | DCU-3G、昇腾 910 | 可替代 A100,H100 仍有差距 |
| 百亿级模型训练 | 昇腾 910、DCU-3G | 壁砺 166 | 完全替代 A100,成本降 40%+ |
| 大模型高并发推理 | M890、DCU-3G | 壁砺 166 | 推理性能超 A100 (INT8),成本减半 |
| 中小模型训推 | M530、PH100 | 昇腾 310 | 全面替代 T4/A10,性价比极高 |
| 存量 CUDA 迁移 | 海光 DCU-3G | - | 迁移成本最低 |
| 边缘低功耗推理 | 昇腾 310 | PH100 | 8W 超低功耗,端侧首选 |
旗舰级训练卡对比
1.1 核心参数对比(单卡)
| 芯片 | 工艺 | FP16 算力 | INT8 算力 | 显存/带宽 | 功耗 | 发布状态 |
|---|---|---|---|---|---|---|
| NVIDIA H100 | 4nm | 989 TFLOPS | 1978 TOPS | 80GB HBM3e / 3350GB/s | 700W | ❌ 禁运,存量稀缺 |
| NVIDIA A100 80GB | 7nm | 312 TFLOPS | 624 TOPS | 80GB HBM2e / 1935GB/s | 400W | ❌ 禁运,二手 18-22 万 |
| 昇腾 910(国测 I 级) | 7nm | 320 TFLOPS | 640 TOPS | 32GB HBM2 / 1280GB/s | 310W | ✅ 国产主力,规模出货 |
| 真武 M890 | 5nm | ~300 TFLOPS | ~600 TOPS | 144GB HBM / 1200GB/s | 350W | ✅ 国产顶级,大模型优选 |
| 海光 DCU-3G(BW1000) | 7nm+ | 240 TFLOPS | 480 TOPS | 64GB HBM3 / 1.6TB/s | 300W | ✅ CUDA 兼容,迁移成本最低 |
| 壁砺 166(BR166) | 7nm | 256 TFLOPS | 512 TOPS | 64GB HBM2 / 1024GB/s | 300W | ✅ 通用 GPU,训推均衡 |
1.2 生态与迁移成本(关键差异)
| 芯片 | 软件栈 | CUDA 兼容 | 大模型适配度 | 集群能力 |
|---|---|---|---|---|
| A100/H100 | CUDA+PyTorch/TensorFlow | ✅ 原生 | ⭐⭐⭐⭐⭐ 全覆盖 | ⭐⭐⭐⭐⭐ 万卡级 |
| 昇腾 910 | CANN+MindSpore | ❌ 不兼容(需重写/迁移) | ⭐⭐⭐⭐ 主流模型适配 | ⭐⭐⭐⭐ 384 卡超节点 |
| DCU-3G | ROCm + 优化库 | ✅ 高度兼容(直接改编译参数) | ⭐⭐⭐⭐ 主流模型可跑 | ⭐⭐⭐ 千卡级 |
| M890 | 平头哥 SDK | ❌ 不兼容 | ⭐⭐⭐⭐ 大模型优化好 | ⭐⭐⭐ 千卡级 |
| 壁砺 166 | BRT | ❌ 不兼容 | ⭐⭐⭐ 主流适配 | ⭐⭐⭐ 千卡级 |
💡 核心差异:海光 DCU-3G 是唯一接近 CUDA 兼容的国产卡,适合快速迁移;昇腾生态最成熟但需迁移;M890/壁砺适合新开发。
国测 I 级 9 款卡详解
2.1 核心参数对比表
| 厂商 | 型号(送测名) | 商用代号 | 工艺 | 显存&带宽 | FP16/BF16 算力 | INT8 算力 | 功耗 | 主要定位 |
|---|---|---|---|---|---|---|---|---|
| 华为海思 | 昇腾 310 | Ascend 310 | 12nm | 8GB DDR4, 60GB/s | 8 TFLOPS | 16 TOPS | 8W | 边缘推理/低功耗 |
| 华为海思 | 昇腾 910 | Ascend 910 | 7nm | 32GB HBM2, 1280GB/s | 320 TFLOPS | 640 TOPS | 310W | 云端训练/大模型 |
| 平头哥(阿里) | 真武 M530 | — | 5nm | 64GB HBM, 800GB/s | ~128 TFLOPS | ~256 TOPS | 250W | 推理 + 中小模型训练 |
| 平头哥(阿里) | 真武 M890 | — | 5nm | 144GB HBM, 1200GB/s | ~300 TFLOPS | ~600 TOPS | 350W | 大模型训推一体 |
| 壁仞科技 | 壁砺 166 | BR166 | 7nm | 64GB HBM2, 1024GB/s | 256 TFLOPS | 512 TOPS | 300W | 云端训练/推理 |
| 海光信息 | DCU-3G | 深算三号 BW1000 | 7nm+ (Chiplet) | 64GB HBM3, 1.6TB/s | 240 TFLOPS | 480 TOPS | 300W | 大模型训练/推理 |
| 天数智芯 | KCC-V100X | 天垓 100 | 7nm | 64GB HBM2, 1024GB/s | 256 TFLOPS | 512 TOPS | 300W | 云端训练/推理 |
| 沐曦 | MXC600 | MX600 | 7nm | 64GB HBM2, 1024GB/s | 256 TFLOPS | 512 TOPS | 300W | 云端训练/推理 |
| 摩尔线程 | PH100 | MTT S5000 | 7nm | 32GB GDDR6, 768GB/s | 96 TFLOPS | 192 TOPS | 220W | 推理/中小模型训练 |
2.2 各卡替代定位总结
| 芯片 | 替代定位 | 对标英伟达 | 推荐场景 |
|---|---|---|---|
| 昇腾 310 | 边缘推理替代 | T4 | 端侧/低功耗推理 |
| 昇腾 910 | 主力训练替代 | A100 | 百亿级训练/推理 |
| 真武 M530 | 中小模型性价比 | A10(T4) | 1B-50B 训推 |
| 真武 M890 | 大模型顶级替代 | A100/H100 | 70B-千亿训推 |
| 壁砺 166 | 通用均衡替代 | A100 | 训推一体/行业模型 |
| DCU-3G | CUDA 迁移首选 | A100 | 存量 CUDA 项目迁移 |
| 天垓 100 | 稳定型替代 | A100 | 推理/中小训练 |
| MXC600 | 能效型替代 | A100 | 高吞吐推理 |
| PH100 | 低功耗推理替代 | T4 | 服务器推理/中小训练 |
场景化选型指南
3.1 大模型训练(10B-千亿级)
| 芯片 | 适合模型规模 | 最佳精度 | 推荐指数 | 关键优势 |
|---|---|---|---|---|
| 昇腾 910 | 10B-千亿 | BF16/FP16 | ⭐⭐⭐⭐⭐ | 算力强、集群生态成熟、千卡线性加速好 |
| 真武 M890 | 10B-千亿 | BF16/FP8 | ⭐⭐⭐⭐⭐ | 144GB 超大显存、FP8/FP4 全栈、5nm 先进工艺 |
| 海光 DCU-3G | 10B-千亿 | BF16/FP8 | ⭐⭐⭐⭐⭐ | 1.6TB/s 带宽、CUDA 兼容、迁移成本最低 |
| 壁砺 166 | 10B-千亿 | BF16/FP16 | ⭐⭐⭐⭐☆ | 算力均衡、国产通用 GPU、训推双强 |
| 天垓 100 | 10B-百亿 | BF16/FP16 | ⭐⭐⭐⭐☆ | 7nm、HBM2、通用计算稳定 |
| 沐曦 MXC600 | 10B-百亿 | BF16/FP16 | ⭐⭐⭐⭐☆ | 架构先进、推理/训练均衡、能效好 |
| 真武 M530 | 1B-50B | BF16/FP16 | ⭐⭐⭐⭐ | 5nm、性价比高、中小模型训练优选 |
| PH100 | 1B-20B | FP16 | ⭐⭐⭐ | 功耗低、推理强、中小模型训练够用 |
| 昇腾 310 | ❌ 不推荐训练 | — | — | 仅边缘推理,算力/显存不足 |
3.2 大模型推理(高并发/低延迟)
| 芯片 | 适合模型规模 | 最佳精度 | 推荐指数 | 关键优势 |
|---|---|---|---|---|
| 真武 M890 | 70B-千亿 | FP8/INT4 | ⭐⭐⭐⭐⭐ | 超大显存 + 超低精度,高并发之王 |
| 海光 DCU-3G | 70B-千亿 | FP8/INT4 | ⭐⭐⭐⭐⭐ | 带宽最高、延迟低、CUDA 生态友好 |
| 壁砺 166 | 34B-70B | INT8/INT4 | ⭐⭐⭐⭐☆ | 算力足、推理吞吐高、国产稳定 |
| 天垓 100 | 34B-70B | INT8/INT4 | ⭐⭐⭐⭐☆ | 通用计算强、推理稳定 |
| 沐曦 MXC600 | 34B-70B | INT8/INT4 | ⭐⭐⭐⭐☆ | 低延迟、高吞吐、能效优 |
| 昇腾 910 | 34B-70B | INT8 | ⭐⭐⭐⭐ | 生态好、推理稳定,适合华为云栈 |
| 真武 M530 | 7B-34B | INT8/INT4 | ⭐⭐⭐⭐ | 5nm、性价比高、中小模型推理 |
| PH100 | 7B-34B | INT8/INT4 | ⭐⭐⭐⭐ | 220W 低功耗、推理能效高 |
| 昇腾 310 | 1B-7B | INT8 | ⭐⭐⭐⭐⭐ | 8W 超低功耗、边缘/端侧推理首选 |
3.3 边缘/端侧推理(低功耗/嵌入式)
| 芯片 | 功耗 | INT8 算力 | 适用场景 | 推荐指数 |
|---|---|---|---|---|
| 昇腾 310 | 8W | 16 TOPS | 摄像头/网关/工控机 | ⭐⭐⭐⭐⭐ |
| PH100 | 220W | 192 TOPS | 边缘服务器推理 | ⭐⭐⭐ |
💡 首选:昇腾 310(8W、INT8 16 TOPS、适配摄像头/网关/工控机)
💡 备选:PH100(220W、但可做边缘服务器推理)
精度支持对比
4.1 精度支持矩阵
| 芯片 | FP32 | BF16 | FP16 | FP8 | INT8 | INT4 | FP4 |
|---|---|---|---|---|---|---|---|
| 昇腾 310 | ❌ | ❌ | ✅ | ❌ | ✅ | ❌ | ❌ |
| 昇腾 910 | ✅ | ✅ | ✅ | ❌ | ✅ | ❌ | ❌ |
| 真武 M530 | ✅ | ✅ | ✅ | ❌ | ✅ | ✅ | ❌ |
| 真武 M890 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 壁砺 166 | ✅ | ✅ | ✅ | ❌ | ✅ | ✅ | ❌ |
| 海光 DCU-3G | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ❌ |
| 天垓 100 | ✅ | ✅ | ✅ | ❌ | ✅ | ✅ | ❌ |
| 沐曦 MXC600 | ✅ | ✅ | ✅ | ❌ | ✅ | ✅ | ❌ |
| PH100 | ✅ | ❌ | ✅ | ❌ | ✅ | ✅ | ❌ |
4.2 精度维度小结
| 精度类型 | 推荐芯片 | 适用场景 |
|---|---|---|
| 仅推理/轻量 | 昇腾 310(FP16/INT8) | 边缘端侧、低功耗 |
| 训练主力(全精度) | 昇腾 910、M890、DCU-3G、壁砺 166、天垓 100、MXC600 | 大模型训练 |
| 超低精度推理 | M890、DCU-3G(FP8/INT4/FP4) | 千亿级大模型高并发推理 |
| 5nm 先进工艺 | 平头哥 M530/M890 | 全精度覆盖,能效优 |
生态与迁移成本
5.1 软件栈对比
| 芯片 | 软件栈 | 框架支持 | 模型库 | 开发工具 |
|---|---|---|---|---|
| A100/H100 | CUDA | PyTorch/TF/JAX | HuggingFace 全支持 | Nsight/CUDA-GDB |
| 昇腾 910 | CANN+MindSpore | PyTorch(适配)/MindSpore | 主流模型适配 | MindStudio |
| DCU-3G | ROCm+ 优化库 | PyTorch(兼容)/TF | 主流模型可跑 | HIP 工具链 |
| M890 | 平头哥 SDK | PyTorch(适配) | 大模型优化好 | 平头哥工具链 |
| 壁砺 166 | BRT | PyTorch(适配) | 主流适配 | 壁仞工具链 |
5.2 迁移工作量估算
| 迁移类型 | 工作量(人天) | 风险等级 | 推荐芯片 |
|---|---|---|---|
| CUDA 原生 → DCU-3G | 3-5 天 | 🟢 低 | DCU-3G |
| CUDA 原生 → 昇腾 910 | 10-20 天 | 🟡 中 | 昇腾 910 |
| CUDA 原生 → M890 | 15-25 天 | 🟡 中 | M890 |
| CUDA 原生 → 壁砺 166 | 10-15 天 | 🟡 中 | 壁砺 166 |
| 新项目 → 任意国产 | 5-10 天 | 🟢 低 | 按需选型 |
推荐方案
6.1 按场景推荐
✅ 新增大模型训练(≥70B)
- 优先:真武 M890 > 海光 DCU-3G > 昇腾 910
- 理由:M890 显存最大 (144GB),DCU-3G 带宽最高 (1.6TB/s)
✅ 存量 CUDA 项目迁移
- 首选:海光 DCU-3G
- 理由:迁移成本最低,仅需修改编译参数
✅ 政企/信创项目
- 优先:昇腾 910、海光 DCU-3G
- 理由:生态成熟 + 兼容性好 + 信创目录
✅ 成本敏感推理
- 优先:真武 M530、PH100、昇腾 310
- 理由:性价比最高,功耗低
✅ 边缘/端侧部署
- 首选:昇腾 310
- 理由:8W 超低功耗,适配摄像头/网关/工控机
6.2 按预算推荐
| 预算范围 | 推荐方案 | 配置建议 |
|---|---|---|
| 100 万以内 | 昇腾 310 × 10-15 卡 | 边缘推理集群 |
| 100-300 万 | 昇腾 910 × 8-16 卡 / DCU-3G × 8-16 卡 | 中小模型训练 |
| 300-500 万 | M890 × 8-16 卡 / DCU-3G × 16-32 卡 | 大模型训练/推理 |
| 500 万以上 | M890 × 16-32 卡 + DCU-3G × 16-32 卡 | 千亿级大模型训练 |
6.3 快速选型一句话建议
千亿大模型训练 → M890、DCU-3G、昇腾 910
70B-千亿高并发推理 → M890、DCU-3G(FP8/INT4)
34B-70B 训推一体 → 壁砺 166、天垓 100、MXC600
中小模型 (1B-34B) → M530、PH100
边缘低功耗 → 昇腾 310
存量 CUDA 迁移 → DCU-3G
附录
A. 无法替代场景
| 场景 | 原因 | 建议 |
|---|---|---|
| 万亿参数超大规模训练(如 GPT-4 级别) | 国产卡算力/互联带宽不足 | 仍依赖 H100 集群 |
| 极端科学计算(如量子、气象) | FP32 精度差距大 | 等待国产卡 FP32 优化 |
B. 关键术语解释
| 术语 | 解释 |
|---|---|
| FP16/BF16 | 半精度浮点,大模型训练主流精度 |
| FP8/INT8 | 8 位精度,推理加速常用 |
| INT4/FP4 | 4 位超低精度,高并发推理 |
| HBM2/HBM3 | 高带宽内存,显存类型 |
| CUDA 兼容 | 可直接运行 CUDA 代码或仅需少量修改 |
| 国测 I 级 | 国家测评认证的最高等级 AI 芯片 |
更多推荐


所有评论(0)