开头:一家法律 AI 创业公司的三天

一家做法律文书生成的 AI 创业公司,团队十几个人,在北京。去年底拿到了第一笔融资,产品 Demo 跑在云端 GPU 上效果不错,今年初决定自建推理集群。CTO 在评估硬件时遇到了一个困境:网上关于昇腾 910B 的信息,一半是厂商的宣传稿,一半是"国产芯片不行"的情绪帖。他花了三天时间搜资料,结论是"没法判断"。

后来他做了一件事——不是继续搜资料,是直接借了一台昇腾机器跑了三天 POC。跑完之后他说了一句话:"网上那些争论,对我这个场景来说,90% 都不相关。"

这件事里最值得说的不是昇腾行不行。而是:绝大多数团队的"昇腾评估",停留在看文章和听厂商宣讲,从来没跑过一行真实业务代码。

今年上半年,我自己参与了四五个昇腾 POC 项目的技术评估。这篇不是告诉你昇腾好还是不好——是告诉你怎么自己判断。

三张红牌:遇到任何一张,先别动手

在谈性能之前,有三件事如果没搞定,后面的所有测试都没意义。任何一张亮出来,说明你还没到跑 benchmark 的阶段。

红牌一:你的模型不在适配清单里

昇腾 910B 目前通过 vLLM-Ascend(当前版本 v0.13.0rc3,2026 年 4 月发布)已经适配的主流开源模型包括:

  • Qwen 系列(Qwen2.5、Qwen3、Qwen3.5)
  • DeepSeek 系列(DeepSeek-V3、DeepSeek-R1、DeepSeek-V4-Flash/Pro)
  • ChatGLM 系列
  • LLaMA 3/4 系列(通过社区适配)
  • Baichuan2/3
  • Yi 系列

如果目标模型不在这份清单里——不是说完全不能跑,但你需要预留额外的适配周期。经验数据:一个不在清单里的中等规模 Transformer 模型,从零适配到稳定推理,目前仍需 1–3 周。

红牌二:你团队里没一个人亲手跑过昇腾 NPU 上的推理

这不是能力问题,是手感问题。昇腾的驱动管理(npu-smi)、显存分配策略(PYTORCHNPUALLOC_CONF)、算子兼容性排查——这些和 CUDA 生态的习惯有差异。如果全组都是第一次碰昇腾,建议前两周不要设产出目标,纯熟悉环境。

一个可操作的建议:先在华为 ModelArts 上申请免费试用实例,跑一遍模型加载→推理→压测的完整流程。把坑在免费环境里踩完,再上物理机。

红牌三:你还没定义"够用"的标准

昇腾的性能数字在网上你可以找到各种各样的版本——从"碾压 A100"到"完全不能用"。差异这么大的原因很简单:测试条件不一样。 模型不同、精度不同、batch size 不同、输入长度不同、框架版本不同,结果可以差几倍。

所以在看任何 benchmark 之前,先定义你自己的"够用"标准。比如:首 Token 延迟 P95 < 500ms、单请求吞吐 > 20 token/s、并发 10 路不降频。有了标准,再看数据才能判断。

三项必测指标——不是"跑分",是"能不能上线"

以下三项是我们在多个 POC 项目中反复验证的结论:这三个指标过了,生产环境大概率能稳住。任何一个没过,上线必出问题。

指标一:模型加载时间(冷启动)

从执行启动命令到模型完成加载、可以接受第一个推理请求的时间。对于 32B 参数级别的模型,在昇腾 910B 上通过 vLLM-Ascend 加载,合理范围是 2–5 分钟(取决于模型格式和存储速度)。

为什么这个重要:生产环境里模型升级、节点替换、故障恢复都需要冷启动。如果加载一个模型要 20 分钟,你的故障恢复 SLA 里光这一步就吃掉了一大块。

实测参考:GPUStack 社区在 8×910B2 环境下部署 DeepSeek-V4-Flash(284B MoE 模型,W8A8 量化),从启动到 Running 状态的加载时间在可接受范围内(具体数字因存储介质和网络条件而异,建议在自己的硬件上实测)。

指标二:首 Token 延迟(TTFT)——P50 和 P95 都要看

这是用户体感最直接的指标。很多 benchmark 只报 P50 或平均值,但生产环境最怕的是 P95 和 P99 的尖刺——平均 200ms 但 P95 飙到 2 秒,意味着每 20 个请求里就有 1 个用户等得不耐烦。

在典型场景下(FP16 精度,Qwen3-32B,输入 2048 tokens,batch=8),昇腾 910B 单卡 P50 TTFT 在 150–250ms、P95 在 300–500ms 是合理区间。如果 P95 超过 800ms,不建议直接上线——先排查是 batch 调度问题还是显存碎片化导致的。

指标三:满载稳定性——跑 30 分钟不降频

这个指标被最多人忽略。CPU 和 GPU 满载跑几分钟看不出问题,真正暴露问题的是持续满载——散热能不能压住、供电能不能稳住、NPU 频率会不会在 20 分钟后断崖式下跌。

操作方法:用并发请求把 NPU 利用率顶到 85–95%,持续跑 30 分钟。同时用 npu-smi 监控温度和频率。如果 30 分钟内频率波动不超过 5%、温度稳定在安全工作范围、无一例请求超时——这个系统的散热和供电通过了最基本的考验。

一个参考数据点:DeepSeek-V4-Flash 在昇腾 910B 上的表现

2026 年 4 月,GPUStack 团队在 8×昇腾 910B2 环境下部署了 DeepSeek-V4-Flash(284B MoE,W8A8 量化),使用 vLLM Ascend v0.13.0rc3 推理引擎,单请求吞吐达到 31 token/s。配置要点:TP8 张量并行、expert parallel 开启、MTP 投机解码(numspeculativetokens=1)、CUDA Graph FULLDECODEONLY 模式。驱动版本要求 CANN ≥ 25.5。

这个数据说明一件事:在正确的引擎版本和配置下,昇腾 910B 跑 MoE 大模型已经能产出"能用的"性能——不是实验室跑分,是实际部署可以达到的水平。但需要注意的是,31 token/s 是单请求场景,并发下的表现取决于 batch 调度和你的具体负载模式。

四个已知的适配限制——提前知道比踩坑后补救强

有些坑是 POC 过程中反复出现的,提前列出来:

限制一:自定义 Attention 实现。 如果你的模型用了非标准的 attention 机制(比如某些学术模型的稀疏注意力变体),在昇腾 NPU 上大概率需要手动重写。标准的 FlashAttention、Multi-head Attention 已有成熟适配。

限制二:动态 Shape 场景。 输入长度分布范围极宽(比如从 50 到 100K tokens 随机分布)时,显存碎片化可能比 CUDA 环境更早出现。建议在 POC 中用你实际业务的输入长度分布跑一轮压测。

限制三:FP8/BF16 混合精度。 昇腾 910B 对 FP16/INT8 支持成熟,但 BF16 和 FP8 的支持在不同 CANN 版本间有差异。如果模型训练时用的是 BF16,迁移前确认目标 CANN 版本的支持状态。

限制四:多节点分布式推理。 单机 8 卡之内的张量并行已经比较成熟。跨节点的流水线并行和专家并行,目前还需要额外的配置和调试——不是不能做,但复杂度比单机 8 卡高一个数量级。

POC 不是跑一遍就完事——应该做三轮

很多团队的 POC 只跑一轮:部署→发几个请求→看 token 速度→得出结论。这个流程不够。

第一轮:功能验证。 模型能不能加载、能不能正常推理、输出内容是不是正确的。这轮的目标不是看速度。

第二轮:压力测试。 按你预期的峰值并发的 1.5 倍跑 30 分钟。同时监控 NPU 利用率、显存占用、温度和延迟的三个分位数(P50/P95/P99)。这轮暴露的是系统瓶颈。

第三轮:业务模拟。 用你真实业务中的典型请求(不一定是长文本、不一定是单轮对话)跑混合负载。比如客服场景可能就是"短输入 + 短输出 + 多轮",代码助手就是"中等输入 + 长输出"。真实业务的延迟分布,和 benchmark 往往不一样。

三轮跑完,你对"能不能上生产环境"的判断会比看十篇文章准确得多。

版本号——这件事比你想象的更重要

截至 2026 年 7 月,昇腾推理栈的推荐版本组合:

组件 推荐版本 说明
CANN(昇腾基础软件栈) ≥ 25.5 DeepSeek-V4 兼容性要求
vLLM-Ascend v0.13.0rc3 2026年4月发布,首次正式支持 DeepSeek-V4
torch-npu ≥ 2.6.0 PyTorch Ascend 适配
NPU 驱动 ≥ 25.5 通过 npu-smi info 查看

CANN 和 vLLM-Ascend 的版本匹配很重要——不匹配的组合可能导致模型加载失败或性能异常。建议在开始 POC 前先确认版本组合在华为昇腾社区的兼容性列表中。

一个较大的变化:相比半年前(2025 年底),vLLM-Ascend 从 v0.11.0rc0 迭代到了 v0.13.0rc3,两个版本之间新增了 DeepSeek-V4 支持、MTP 投机解码、expert parallel 和多项性能优化。如果你用的是半年前的"昇腾体验",建议用最新版本重新评估——差距可能比你预想的大。

写在最后

开头那家法律 AI 创业公司的 CTO,跑完三天 POC 之后的决策是:生产环境用 2 台昇腾 910B 整机做负载均衡,模型选 Qwen3-32B(INT8),首批支撑日均 2000–3000 次法律文书生成请求。为什么是 2 台而不是 1 台?不是因为性能不够——是"一台机器挂了,另一台立刻接管"的高可用要求。这个需求跟昇腾还是 NVIDIA 没关系,跟他的业务 SLA 有关系。

回到标题里的"别被标题骗了"。网上关于昇腾的内容,有两种最不值得看:一种是"国产之光全面超越",一种是"国产芯片全是垃圾"。因为这两种都没有测试条件、没有场景限定、没有对比基准。

有用的信息长这样:在什么模型上、用什么框架版本、精度多少、batch size 多少、输入输出长度多少、跑了多少并发、P50 和 P95 分别是什么。

这篇文章里的数据都带着这些条件。如果你准备做昇腾 POC,建议也按这个格式记录你跑出来的数据——不是为了给别人看,是为了以后你自己回溯的时候,知道当时的判断是基于什么条件做出的。

推荐阅读:

DeepSeek 私有化部署硬件选型实战:从 32B 蒸馏版到 671B 满血版双路线评估-CSDN博客

RTX 5090涨价缺货怎么办?企业杠部署第三条路:RTX+昇腾双路线评估 - 数聚红芯

RTX 5090 涨价交期排到年底,企业 AI 部署还有第三条路-CSDN博客

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐