模型为芯片而生:DeepSeek V4 与昇腾 950 的共谋改变了什么

核心观点:DeepSeek V4 不是"适配"了昇腾,而是为昇腾"协同设计"——当开源世界最有分量的模型把架构写成昇腾原生,国产算力第一次摸到了生态定义权。

这是一篇深度研究,不是新闻简报。基于 30+ 个来源的交叉验证,覆盖技术架构、竞争格局、市场影响三个维度。

证据等级:[A] 官方/一手 [B] 2+可靠来源 [C] 单一来源 [D] 个人判断

封面

一、被误读的"八芯适配"

4 月 24 日 DeepSeek 发布 V4:1.6 万亿总参数、490 亿激活的 MoE,1M 上下文,开源权重。主流叙事把它包装成"国产算力里程碑"——八家国产芯片厂商 Day 0 全量适配。

但这份叙事漏了最重要的细节。SemiAnalysis 在 6 月 17 日发布昇腾 950DT 的指令级拆解,结论直接推翻"适配"这个词:V4 的推理路径,在发布之前就是照着昇腾的硬件写出来的。稀疏矩阵乘、专家路由的 Expert Gather 指令、FP4/FP8 混合精度——这些 V4 架构里最核心的设计,恰好都是昇腾 NPU 最擅长、而通用 GPU 并不天生优化的东西。[A]

黄仁勋在 4 月 15 日播客里说,DeepSeek 若率先在华为芯片上跑通,对美国是"糟糕的结果"。他没说完的下半句才是重点——他怕的不是"跑通",而是 CUDA 失去默认优化特权。[B]

二、技术纵深:V4 架构里写着昇腾的名字

V4 相对 V3 做了四个激进改动,每一个都偏离 GPU 惯例:

设计 V4 的取舍 对昇腾的意味
注意力 抛弃 MLA,改 CSA+HCA 混合压缩注意力 稀疏索引与全局压缩贴合 NPU 稀疏访存
多 Token 预测 原生 MTP(同时预测 t+1…t+3) 让 decode 从访存密集转向算力密集
精度 FP4 专家 + FP8 非专家 950PR 是国产唯一原生 FP4 芯片
残差 mHC 流形约束超连接 减少中间激活,省显存带宽

1M 上下文下,V4-Pro 每 token 的 FLOPs 只有 V3.2 的 27%,KV 缓存只有 10%。[B] 在 1M 上下文场景里,KV 缓存是从显存里"挤"出来的,10% 意味着同样的卡能塞下十倍长的上下文,也意味着昇腾相对小的片上内存不再是致命伤。

昇腾 950DT 最关键的三个数字:144GB 片上 HiZQ 2.0 内存、4TB/s 带宽、2TB/s 片间互联。[A] 144GB 对 MoE 推理是决定性的——1.6T 总参数、49B 激活的 V4-Pro,所有专家权重放上单卡后,推理只需搬运激活参数。这是"全部专家常驻"与"专家换入换出"的本质区别。

Atlas 950 SuperPoD 在 WAIC 2026 真机首秀:1024 卡、1 EFLOPS FP8、256TB 统一编址、3μs RTT,最大可扩到 8192 卡。256TB 统一编址意味着 1.6T 参数的权重与 KV 可全部驻留在同一逻辑内存空间,应用层不需要做跨机调度。

华为公布的数字:V4-Pro 在 950DT 上单卡 decode 约 4700 TPS、TPOT 约 20ms。对比 H20,FP4 算力 2.87 倍。需要诚实标注:这是厂商口径、8K 输入的离线指标。

真正的独立验证来自另一个方向。SemiAnalysis 的追踪显示,V4 发布当天只有 CUDA 和 CANN 两套栈能跑完整推理:AMD ROCm 只有 1-2 tok/s,NVIDIA 自己的 TensorRT-LLM 还踩了一个静默内存损坏的 bug,修了几周。[A] V4 发布当天能"完整"跑起来的推理栈只有两套——CUDA,和昇腾 CANN。

上图:V4 的四个激进设计与昇腾 950 硬件能力的对应关系。

三、竞争格局:八家赛马与英伟达的侧门

"八家国产芯片 Day 0 适配"是被扁平化的表述。严格拆解:Day 0(4 月 24 日)只有昇腾和寒武纪;Day 1(4 月 25 日)海光、摩尔线程、沐曦、昆仑芯、平头哥、天数智芯六家通过智源 FlagOS 补齐 Flash 版适配;壁仞单独完成了 Pro 版适配。[B] 唯一在 Day 0 拿出完整、可验证推理性能的国产栈,只有昇腾。

智源 FlagOS 做了三件事:FlagGems 全算子替换(Triton 写,不依赖 cuDNN/cuBLAS)、统一张量并行策略、FP4+FP8→BF16 精度转换。这套抽象层让"写一次、跑八家"成为可能,但代价是性能上限被锁在通用算子层——这就是为什么六家 Day 1 适配都没拿出可审计的性能数字。

厂商 芯片 V4 适配 公开性能
华为 昇腾 950DT/950PR Day 0,协同设计 4700 TPS 单卡 decode
寒武纪 思元 590/690 Day 0,代码开源 无公开 V4 数据
摩尔线程 夸娥 S5000 Day 1 V4-Flash 吞吐 +65.7%
沐曦 曦云 C500/C600 Day 1 无公开 V4 数据
海光 深算 DCU3 Day 1 无 V4 数据
昆仑芯/平头哥/天数 P800/真武/天核 Day 1 仅验证
NVIDIA H20/H200 CUDA Day 0 中国份额已跌至约 8%

对比表:八家中只有华为拿出了可审计的 V4 性能数字。

英伟达在中国三条路全受阻。H20 是被阉割的降级产品,算力密度只有 H100 的约 40%,被中国云厂商用脚投票;H200 获准出口但到 2026 年 Q1 实际营收是零——北京以"战略陷阱"为由按住了审批。[B] 于是英伟达打出第四张牌:把独立的 Vera CPU 卖给中国。

Vera CPU 不是降级产品,而是一台完整的 88 核 Armv9.2 服务器 CPU,1.2TB/s 内存带宽,定价"远高于"2 万美元。[B] 精妙之处在于:出口管制管的是 GPU,不管 CPU——这是监管后门。中国头部云厂商已计划采购 300+ 台双路 Vera 服务器做测试。但这条路同样悬:AMD Venice 256 核声称单机柜吞吐是 Vera 的 3.3 倍,美国也可能把管制扩展到 CPU。[D]

上图:2026 年国产算力与英伟达中国路线的关键节点。

四、市场与生态:估值、产能与定义权

DeepSeek 的融资曲线三个月内被改写:4 月锚定 100 亿美元估值,5 月 28 日第一轮交割、投后约 520 亿美元、大基金首次投资一家大模型公司,7 月第二轮投前估值已到 710 亿美元,A 股 IPO 已列入 2027 年科创板日程。[B] 最有象征意义的不是金额,而是大基金——这个历史上只投中芯、长鑫等硬件的国家队,第一次把钱放进了一家软件公司。

7 月 31 日彭博报道,DeepSeek 计划在内蒙古乌兰察布建设 1GW 级智算中心,投资约 350 亿美元,采用"自建+租赁"混合模式。但最关键的芯片方案至今未被证实——彭博原文说"尚不清楚用谁的芯片",中国部分自媒体声称"全部国产",而 8 月 8 日中国日报的说法更保守:双方都未承诺建设。[C] 1GW 国产方案目前是叙事,不是事实。

产能账很朴素:中芯 N+2 年产能约 260 万颗,2026 年需求约 420 万颗,缺口 40%;华为独占 43% 产能。[B] 昇腾 950 2026 年计划出货约 75 万颗(路透),字节跳动一家就锁走了一半;HBM 是更硬的瓶颈——国产 HBM3 要等长鑫 2028 年才可能规模化。梁文锋在 7 月内部会上说的那句"华为的问题是产能,不是技术",是对全局最精准的概括。[C]

7 月 31 日国产算力板块"史诗级大反攻":科创芯片 ETF 涨 7.9%,寒武纪 20cm 涨停、市值一度站上 5000 亿。[B] 政策底座更厚:国家规划五年 2 万亿建全国算力网、2028 年国产芯片占比不低于 80%;日本 8 月 1 日起对先进封装设备实施全面出口许可,反向加速国产封装替代。

上图:国产算力的供需结构——需求被开源模型点燃,供给被产能与 HBM 卡住。

五、三个层次的博弈

第一层是"推理先行"。国产芯片今天真正攻下的是推理市场——昇腾 950DT 的 decode 已摸到 H100 的 85-90%,成本只有约四分之一。[B] 但训练仍是英伟达的天下:V4 技术报告刻意不披露预训练硬件,行业共识是"H800 训练 + 昇腾推理/续训练"的混合结构,"弃 CUDA"叙事被夸大了。[C] 需要看到的是,6 月 5 日昇腾 910C 集群已完成 V4-Pro 1.6T 全参数后训练,MFU 34.22%,这堵墙正在被一点点凿穿。[A]

第二层是"生态反向渗透"。V4 的开源让昇腾从"国产替代选项"变成"全球开发者默认选项"之一。技术报告同期发布的 TileLang 是一套旨在逃离 CUDA 的 GPU 算子语言——DeepSeek 不只在芯片层面做国产化,还在工具链层面给整个行业留了退路。

第三层是"定义权"。当开源世界最有影响力的模型把架构做成昇腾原生,开发者生态会围绕 CANN 生长,正如二十年前围绕 CUDA 生长。我判断:未来一年国产算力最大的变量不是芯片性能,而是"模型-芯片"协同设计的深度——谁能让模型为自家芯片而生,谁就掌握了生态的定义权。[D]

六、我的判断

我原以为"国产算力跑万亿模型"是工程成就,现在看是范式转折。V4 与昇腾的协同设计,第一次让"芯片定义模型"变成了现实——这在 AI 芯片史上只有 CUDA 时代做到过。

最需要保持清醒的三点。第一,性能数字基本是厂商口径,4700 TPS 是离线最优值,真实在线负载要等 950DT 8 月上线华为云后才有独立验证。第二,"国产训练闭环"仍未完全跑通,预训练依旧是英伟达主导,910C 的 34% MFU 后训练是进步,但离端到端国产还有距离。第三,乌兰察布 1GW 的芯片方案悬而未决,它可能是国产算力最大的增量订单,也可能只是一篇彭博报道。

我判断方向是确定的:模型为芯片而设计的循环一旦转起来,就不会倒转。MiniMax H3 在 8 月 3 日复制了同样的 Day 0 模式,说明这不是 DeepSeek 的孤例,而是中国开源生态的默认打法。下一个观察窗口是 9 月——昇腾 950 超节点批量商用时,V4 的推理价格会降多少,那是国产算力真正交卷的时刻。


参考来源(部分)

  1. SemiAnalysis InferenceX — DeepSeek V4 Day 0→43 Performance
  2. 华为 — Atlas 950 SuperPoD 发布
  3. DeepSeek-V4 技术报告(arXiv:2606.19348)
  4. 路透 — 中国科技巨头抢购昇腾 950
  5. 彭博 — DeepSeek 乌兰察布 1GW 数据中心
  6. 芯东西 — 8 大国产 AI 芯片适配 DeepSeek-V4
  7. 人民日报 — DeepSeek 跑在国产芯片上意味着什么
  8. 财新 — 大基金领投 DeepSeek

AI 辅助深度研究,人工视角解读。 每日更新。

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐