一、驱动安装

1)创建用户

groupadd HwHiAiUser

useradd -g HwHiAiUser -d /home/HwHiAiUser -m HwHiAiUser -s /bin/bash

2)获取显卡对应的驱动(910B)

社区版-固件与驱动-昇腾社区

3)安装NPU驱动

chmod +x Ascend-hdk-910b-npu-driver_25.5.2_linux-aarch64.run

./Ascend-hdk-910b-npu-driver_25.5.2_linux-aarch64.run --full --install-for-all

        (1)安装NPU固件

chmod +x Ascend-hdk-910b-npu-firmware_*.run

./Ascend-hdk-910b-npu-firmware_*.run --full

        (2)安装CANN

软件包名称

说明

Ascend-cann-toolkit_9.0.0_linux-aarch64.run

开发套件,包含推理/训练工具链、AI框架适配、ATC模型转换工具等

Ascend-cann-910b-ops_9.0.0_linux-aarch64.run

面向 Atlas A2 系列 的算子包,910B4 属于 A2 系列,必须安装此包

Ascend-cann-nnal_9.0.0_linux-aarch64.run

加速库(如深度神经网络库),建议安装,可提升运行时性能

Ascend-docker-runtime_7.1.RC1_linux-aarch64.run

昇腾显卡的运行时环境

(3)安装Ascend-cann-toolkit

chmod +x Ascend-cann-toolkit_9.0.0_linux-aarch64.run

./Ascend-cann-toolkit_9.0.0_linux-aarch64.run --install --install-path=/usr/local/Ascend

echo "source /usr/local/Ascend/cann/set_env.sh" >> ~/.bashrc

source ~/.bashrc

(4)安装 Ascend-cann-ops

chmod +x Ascend-cann-910b-ops_9.0.0_linux-aarch64.run

./Ascend-cann-910b-ops_9.0.0_linux-aarch64.run --install --install-path=/usr/local/Ascend

更新环境变量

source ~/.bashrc

(3)安装Ascend-cann-nnal

chmod +x Ascend-cann-nnal_9.0.0_linux-aarch64.run

./Ascend-cann-nnal_9.0.0_linux-aarch64.run --install --install-path=/usr/local/Ascend/nnal --install-for-all --quiet --nox11

添加环境变量

echo 'source /usr/local/Ascend/nnal/nnal/atb/set_env.sh' >> ~/.bashrc

source ~/.bashrc

(5)安装Ascend-docker-runtime

chmod +x Ascend-docker-runtime_7.1.RC1_linux-aarch64.run

./Ascend-docker-runtime_7.1.RC1_linux-aarch64.run --install

systemctl daemon-reload && systemctl restart docker

二、大模型启动

1)启动容器

docker run \
  --name vllm-qwen35 \
  --net=host \
  --shm-size=8g \
  --pids-limit -1 \
  --cap-add=SYS_ADMIN \
  --cap-add=IPC_LOCK \
  --cap-add=SYS_RESOURCE \
  --security-opt seccomp=unconfined \
  --restart unless-stopped \
  --device /dev/davinci6 \
  --device /dev/davinci_manager \
  --device /dev/devmm_svm \
  --device /dev/hisi_hdc \
  -v /usr/local/dcmi:/usr/local/dcmi \
  -v /usr/local/Ascend/driver/tools/hccn_tool:/usr/local/Ascend/driver/tools/hccn_tool \
  -v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
  -v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
  -v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
  -v /etc/ascend_install.info:/etc/ascend_install.info \
  -v /app/models:/app/models \
  -e CUDA_VISIBLE_DEVICES=1 \
  -e ASCEND_RT_VISIBLE_DEVICES=1 \
  -itd \
  m.daocloud.io/quay.io/ascend/vllm-ascend:v0.19.1rc1-openeuler \
  /bin/bash

2)进入容器,启动模型

vllm serve /app/models/Qwen3.5-35B-A3B-w8a8-mtp \
    --host 0.0.0.0 \
    --port 10080 \
    --served-model-name "qwen3.5" \
    --default-chat-template-kwargs '{"enable_thinking": false}' \
    --tensor-parallel-size 1 \
    --data-parallel-size 1 \
    --quantization ascend \
    --max-num-seqs 128 \
    --max-model-len 16384 \
    --max-num-batched-tokens 16384 \
    --gpu-memory-utilization 0.85 \
    --trust-remote-code \
    --enable-prefix-caching \
    --block-size 128 \
    --async-scheduling \
    --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
    --additional-config '{"enable_cpu_binding": true, "use_triton_moe": true, "multistream_overlap_shared_expert": true}' \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_coder

3)测试模型

curl http://localhost:10080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.5",
    "messages": [
      {"role": "system", "content": "你是一个有帮助的AI助手"},
      {"role": "user", "content": "请介绍一下你自己"},
      {"role": "assistant", "content": "我是Qwen3.5,一个AI语言模型"},
      {"role": "user", "content": "你能做什么?"}
    ],
    "max_tokens": 10000,
    "temperature": 0.7
  }'
  

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐