Ascend950DT版本速配表
一句话让Agent变成昇腾专家,不必再找人问了。评测入口:
(To Agent)请按这个开源仓接入昇腾图谱 https://gitcode.com/agent0/kg-tools
950DT 是昇腾 950 系列里走高带宽路线的款型。官方口径很明确:DT 代表 Decode & Training,面向 decode 和训练场景,特点是更高的访存带宽;PR 代表 Prefill & Recommendation(来源:昇腾 CANN 公众号架构详解,2026-04)。
它和 950PR 共享 DAV_3510 架构和绝大部分软件栈,但规格档位、内存子系统、典型整机形态都不同,直接照抄 PR 的资料容易踩错。这篇手册按「总表 → 硬件身份 → 系统栈 → 应用栈 → 可抄组合 → 排错与注意事项」组织。版本信息截至 2026-09,出处逐节标注,查不到的写明 [未核实]。
一页总表:从驱动到框架
| 层 | 组件 | 版本要求 | 出处 |
|---|---|---|---|
| 驱动 | Ascend HDK | 随 Atlas A5 950DT 整机交付;950 系社区测试面 26.0.RC1 / 25.5.2 / 25.5.1(出自 950PR 产品报告);DT 专属门槛未见单列 [未核实] | QA 测试报告 |
| 操作系统 | EulerOS 2.0 SP12 / Ubuntu 24.04 LTS / openEuler 22.03 LTS SP4 | x86_64 与 aarch64 双架构包;A5 整机实跑以 aarch64 为主 | QA 测试报告 |
| 异构计算架构 | CANN | 9.0.0 起正式在列(cann-runtime 2026/4 声明支持 950PR/950DT);9.1.0 推荐;9.2.0 仅为 SIMD C API 样例门槛,发布状态未知 [未核实] | release notes |
| 芯片算子包 | Ascend-cann-950-ops | 950PR 与 950DT 共用(soc 统一写 950);与 toolkit 同 install-path | 安装指南 |
| 框架适配 | TorchNPU(torch_npu) | 2.7.1.post8 / 2.9.0.post6 / 2.10.0.post4 / 2.11.0 / 2.12.0,均配 CANN 9.1.0;裸 2.7.1 不识别 950;无 2.8 线 | TorchNPU 26.1.0 配套表 |
| 算子语言 | triton-ascend | 3.2.1 对 CANN 9.0.0,3.2.2 对 CANN 9.1.0,强绑定一一对应;DT 专属实测记录未见公开 [未核实] | MindSpeed-LLM release notes |
| Python | 版本面 | TorchNPU 3.9-3.13;triton-ascend 3.9-3.11;同装取交集 3.9-3.11 | 同上 |
| 推理框架 | vllm-ascend | CANN 9.1.0 + torch 2.10.0 + TorchNPU 2.10.0.post4 + NNAL 9.1.0;提供 950DT 专用镜像 tag | vllm-ascend 安装文档 |
| 训练框架 | MindSpeed LLM 26.1.0 | CANN 9.1.0 + TorchNPU 26.1.0 + triton-ascend 3.2.2 + Megatron core v0.12.1 + Python 3.10 | release notes |
| 配方生态 | cann-recipes | DeepSeek-V3 预训练(8× Atlas A5 950DT);盘古 7B / Qwen3.5-MoE 推理(950PR/DT) | cann-recipes 仓库 |
用法一句话:从上往下是依赖方向,任何一层不满足,上层全部白装。装环境前把每一行的版本抄下来,对着本机逐项核对。
硬件身份:950DT 与 950PR 的边界
npu-smi 打出来的字符串分三层读:
| 层 | 值 | 含义 |
|---|---|---|
| SocVersion | ASCEND950 | 代际枚举值,PR/DT 共用,编译期常量 |
| 款型 | 950DT | Decode & Training,4TB/s 高访存带宽路线 |
| 后缀 _NNNN | silicon bin(晶圆分 bin) | 与 PR 同池不同实例(配置族 950DT_957x / 950DT_958x);DT 的公开样例串未见 [未核实] |
soc_version 的官方解析规则:npu-smi info -t board -i <id>,取 Chip Name 与 NPU Name 拼接。禁止硬编码,代码里判断 SocVersion 或 NpuArch 即可。
一个容易误解的点:950PR 和 950DT 不是同一颗芯片的两个名字。两者同属 DAV_3510 架构、共用 ASCEND950 这个 SocVersion,但合封的内存子系统选型不同——PR 走 HiBL 1.0(高容量低成本,8 个内存模块),DT 走 HiZQ 2.0(高访存带宽,4 个模块),核心档位和规格也因此分叉(白皮书表 3-1 + 社区 meetup 披露)。
差异速览(仅列核实到的事实):
| 维度 | 950PR | 950DT |
|---|---|---|
| 定位 | Prefill & Recommendation | Decode & Training |
| Cube / Vector 档位 | 32/28 · 64/56 | 36/32/28 · 72/64/56 |
| 内存 | 128/112GB @ 1.6/1.4TB/s | 144/96GB @ 4TB/s |
| L2 Cache | 128/112MB 两档 | 仅 128MB |
| 顶档算力(MXFP4) | 1784 TFLOPS | 2007 TFLOPS |
| 典型整机 | Atlas 350 加速卡(PCIe 标卡) | Atlas A5 950DT 系列(8 卡 Server 起步,超节点组网至 1024P) |
| 训练 | 偏推理/推荐定位 | 预训练与后训练配方均有实锤 |
共性同样重要:UB 容量 248KB 两款一致,UB 互联(2016GB/s 双向)、PCIe 5.0、DVPP IO 完全相同,ISA 指令级同实现、无 DT 分叉。所以软件栈是一套,款型差异主要体现在性能档位和使用场景上。
架构别名提醒:A5 是产品代际名,NpuArch 写作 DAV_3510,算子仓目录简写 arch35。V351 是弃用别名,David V100 是营销名,查资料前先换算。
系统栈:CANN、HDK、OS、容器
CANN 版本时间线
| CANN | 950 系支持度 | 备注 |
|---|---|---|
| 8.5.0 | 预览级 | 个别样例 README 声明可用,正式时间线不以此为据 |
| 9.0.0 | 正式在列 | cann-runtime 2026/4 宣布支持 950PR/950DT;首次引入 SIMD C API |
| 9.0.1 | 9w+ 用例全 Pass | 社区 QA 报告(产品型号为 950PR);DT 专项测试报告未查到 [未核实] |
| 9.1.0 | 推荐版本 | 大量 C API 修复与新增;SIMD C++ API 样例对 950PR/DT 门槛即 9.1.0 |
| 9.2.0 | SIMD C API 样例门槛 | 发布状态未知 [未核实] |
包形态与 950 系通用,9.x 有目录变化:
# 9.x:两包制,install-path 必须一致;DT/PR 共用 950-ops
./Ascend-cann-toolkit_9.1.0_linux-x86_64.run --full
./Ascend-cann-950-ops_9.1.0_linux-x86_64.run --install
source ${PATH-TO-CANN}/cann/set_env.sh
# 8.5.0 及更早是 ${PATH-TO-CANN}/ascend-toolkit/set_env.sh
推理场景再加 nnal 包(提供 libatb.so)。
HDK 与 OS
950 系社区测试面为 HDK 26.0.RC1、25.5.2、25.5.1。分产品门槛表(vCANN-RT)里目前没有 950PR/950DT 行,软切分方案文档尚未覆盖 950 系 [未核实]。DT 以整机形态交付(Atlas A5 950DT 系列,最少 8 卡),驱动随整机走,单独升级前先与整机配套表核对。
容器
CANN 基础镜像在 quay.io/ascend/cann,tag 规则「CANN 版本-芯片-OS-Python」。vllm-ascend 为 950DT 提供专用镜像 tag(quay.io/ascend/vllm-ascend:<版本>-950dt),推理部署直接用它最省事。设备挂载与 910B 同一套:/dev/davinciN、davinci_manager、devmm_svm、hisi_hdc 加驱动目录。A5 代际不支持 NNAE、NNRT、MCU、Docker 镜像组件,新增 UBEngine。
应用栈:TorchNPU、triton-ascend、训练与推理生态
TorchNPU 配套表
TorchNPU 26.1.0(2026-07 正式版)release notes 的款型适配声明写的正是 950DT:「支持 Ascend 950DT 款型——将已有 TorchNPU 能力在 Ascend 950DT 中适配」。官方配套表:
| TorchNPU 分支 | 安装包版本 | torch | CANN | Python |
|---|---|---|---|---|
| v2.7.1 | 2.7.1.post8 | 2.7.1 | 9.1.0 | 3.9-3.13 |
| v2.9.0 | 2.9.0.post6 | 2.9.0 | 9.1.0 | 3.10-3.13 |
| v2.10.0 | 2.10.0.post4 | 2.10.0 | 9.1.0 | 3.10-3.13 |
| v2.11.0 | 2.11.0 | 2.11.0 | 9.1.0 | 3.10-3.13 |
| v2.12.0 | 2.12.0 | 2.12.0 | 9.1.0 | 3.10-3.13 |
经验边界(同代 950PR 环境实测,款型无关、SoC 表同源):2.6.0.post5 与裸 2.7.1 都会报 Unsupported soc version;2.11.0、2.12.0 可用。torch 用 +cpu wheel。2.8 线不存在,2.7.1 与 2.9.0 之间断档。
triton-ascend 与 CANN 强绑定
对应关系与款型无关:3.2.1 配 CANN 9.0.0,3.2.2 配 CANN 9.1.0,MindSpeed-LLM release notes 原文强调强绑定、一一对应。pypi 主站止于 3.2.0 且与 CANN 9.1 有枚举改名不兼容,用 3.2.1 以上要加华为云源:
pip install triton-ascend --extra-index-url=https://mirrors.huaweicloud.com/ascend/repos/pypi
仓库在迁移:GitCode 的 Ascend/triton-ascend 已声明搬到 github.com/triton-lang/triton-ascend,提 issue 去新仓。
训练与推理生态
| 组件 | 950DT 支持事实 |
|---|---|
| MindSpeed LLM 26.1.0 | GA,「支持 Ascend 950 系列」;DeepSeek-V3 预训练配方落地在 8× Atlas A5 950DT |
| MindSpeed-MM | --soc 取值含 ascend950,配套 triton-ascend 3.2.1;FLUX DanceGRPO 后训练在 Atlas 950 服务器 |
| vllm-ascend | 安装矩阵含 950DT(Atlas 950DT inference series),专用 -950dt 镜像 |
| 推理配方 | 盘古 7B(950PR/DT;mxfp8 量化仅 A5 硬件);Qwen3.5-MoE(950PR/DT,CANN 9.1.0;FP8/MXFP8 量化仅 950 系) |
| HIXL | CacheManager 产品支持表明确 950PR/950DT |
| NPU Simulator | 仅支持 950PR/950DT(算子精度/性能调优仿真) |
| CATLASS | 提供 Atlas A2 → Ascend 950 迁移指南 |
一个预期管理:PD 分离(prefill-decode 分离部署)目前官方教程与配方都落地在 A2/A3 同构组网(如 DeepSeek-R1 2P1D 用 4× 800T A3);「PR 做 prefill + DT 做 decode」的异构组网暂无公开文档或配方 [未核实]。想做这种组网,先和华为支持渠道确认支持状态。
可直接抄的版本组合
组合 A:CANN 9.1.0 全配套(推荐)
# 前置:整机驱动随 Atlas A5 950DT 交付,OS 见总表
./Ascend-cann-toolkit_9.1.0_linux-aarch64.run --full
./Ascend-cann-950-ops_9.1.0_linux-aarch64.run --install # 同 install-path
source ${PATH-TO-CANN}/cann/set_env.sh
# Python 3.9-3.11(triton-ascend 收窄面)
pip install torch==2.7.1+cpu
pip install torch-npu==2.7.1.post8 triton-ascend==3.2.2 \
--extra-index-url=https://mirrors.huaweicloud.com/ascend/repos/pypi
组合 B:CANN 9.0.0 存量环境最小改动
pip install torch-npu==2.7.1.post8 \
--extra-index-url=https://mirrors.huaweicloud.com/ascend/repos/pypi
# triton-ascend 保持 3.2.1(对 CANN 9.0.0),torch 2.7.1+cpu 不动
组合 C:vllm-ascend 推理整栈
直接用 950DT 专用镜像:quay.io/ascend/vllm-ascend:<版本>-950dt(内含 CANN 9.1.0 + torch 2.10.0 + TorchNPU 2.10.0.post4 + NNAL 对应栈),省去手工配对。
组合 D:MindSpeed LLM 训练整栈
CANN 9.1.0 + TorchNPU 26.1.0 + triton-ascend 3.2.2 + Megatron core v0.12.1 + Python 3.10,参考 DeepSeek-V3 预训练配方(8 卡起步,aarch64 镜像)。
排错对照与 950 系注意事项
通用排错对照表
| 症状 | 断链层 | 修复 |
|---|---|---|
| Unsupported soc version: Ascend950xx xxxx | torch_npu 版本早于 950 适配 | 换 2.7.1.post8 或 2.9 以上线 |
| import torch_npu 报 undefined symbol、SIGSEGV、is_available() 为 False | torch_npu 与 CANN 运行时不配套 | get_cann_version() 对比编译期版本,按配套表对齐 |
| 编译报 RT_LIMIT_TYPE_SIMT_WARP_STACK_SIZE 之类枚举未定义 | pypi 的 triton-ascend 3.2.0 配了 CANN 9.1 | 升 3.2.1 及以上,加华为云源 |
| source set_env.sh 报文件不存在 | 8.x 与 9.x 目录结构变化 | 9.x 改用 ${PATH-TO-CANN}/cann/set_env.sh |
| SIMT kernel 数据静默错值或越界 | UB 硬编码 248KB,未扣 DCache | SIMT 场景再预留 40KB |
| 代际判断失效 | 误用 DAV_C310 内部宏 | 等价 DAV_3510,用 NpuArch 判断 |
950 系特有的能力边界
这些点款型相关或 950 系共性,迁移老代码或选型时要知道:
- 4:2 结构化稀疏不支持(sparsity=0),Cube/MatMul 代码不得假设稀疏能力
- MXFP8 量化暂不支持 ge_graph 模式,用 eager 或 npugraph_ex(Qwen3.5-MoE 配方口径)
- ChunkGDR 融合算子(npu_chunk_gated_delta_rule)仅 A3 支持,950 系暂不支持,有自动回退
- HIXL 的 remap_registered_memory 在 950PR/950DT 上不支持(A2/A3 无此限制)
- vCANN-RT 算力软切分产品表尚未覆盖 950 系
- 正向能力:FP8/MXFP8 低比特量化推理是 950 系配方的主战场(Qwen3.5-MoE、盘古 7B 等),A2/A3 反而没有
五步自检
- npu-smi info 能看到卡,
npu-smi info -t board -i <id>确认款型与 bin - version.cfg 对上目标 CANN,950-ops 已装
- python 打印 torch_npu 版本,确认带 post 后缀或 2.9 以上线
- triton-ascend 版本与 CANN 一一对应(3.2.1 对 9.0.0,3.2.2 对 9.1.0)
- 最小 kernel 上板跑通,再跑业务
import 成功不等于环境可用,真正的门禁是最小 kernel 上板跑一遍。950 生态每周都在补齐,这篇的版本号会过期,方法不会:先分层,再对矩阵,最后上板验证。
参考资料
- 昇腾 950 NPU 架构白皮书(规格与款型差异的真源)
- TorchNPU 版本配套表:pytorch 仓 docs/zh/release_notes.md(TorchNPU 26.1.0)
- triton-ascend:github.com/triton-lang/triton-ascend
- vllm-ascend 安装文档与 950DT Quickstart:vllm-ascend docs(inference-serving 仓)
- MindSpeed-LLM release notes:MindSpeed-LLM 仓 docs/zh/release_notes_llm.md
- cann-recipes 训练/推理配方:DeepSeek-V3(8× Atlas A5 950DT)、盘古 7B、Qwen3.5-MoE
- 社区 QA 测试报告:CANN 9.0.1 / 9.1.0-beta.1(cluster-infra/community/QA)
- 昇腾 CANN 公众号《面向 Ascend 950 的架构详解》(款型命名官方口径,2026-04)
更多推荐




所有评论(0)