深度 | V4 上国芯最难的不是芯片:200 个算子重写、30 人年,性能从 1/35 追回来
深度 | V4 上国芯最难的不是芯片:200 个算子重写、30 人年,性能从 1/35 追回来
核心观点:DeepSeek V4 上国产芯片,卡点从来不是芯片算力,而是那层没人细看的软件适配——约 200 个核心算子重写、十万级精度一致性测试、约 30 人年底层代码改造,初始推理性能只有终版的 1/35。「弃 CUDA」是媒体叙事,技术报告的原文只是「在英伟达与昇腾上同时验证」。
证据等级:[A] 官方/一手 [B] 2+可靠来源 [C] 单一来源 [D] 个人判断

一、被「弃 CUDA」叙事掩盖的真问题
过去四个月,「V4 上国芯」讨论停在两个层面:能不能跑(性能账)、够不够用(产能账)。上一期拆了产能账,但更深的问题被口号盖住了:为了让 1.6T 参数的模型在国产芯片上跑起来,DeepSeek 和国产厂商到底付了多少软件成本?
先纠正流传最广的说法。「DeepSeek V4 抛弃 CUDA、全栈国产化」——这是媒体叙事,不是技术事实 [B]。技术报告第 3.1 节原文是:细粒度专家并行(EP)方案「在英伟达 GPU 与华为昇腾 NPU 上同时验证」[A]。V4 确实是第一家把昇腾当 Day-0 一等公民的头部模型,但「同时验证」不等于「完全切换」——开源权重是 CUDA 生态的,昇腾优化代码并未开源,预训练大概率仍是 H800 与昇腾混跑。
V4 对硬件的「口味」很特殊:Pro 版 1.6T 总参、每 token 激活仅 49B;注意力换成混合稀疏机制;专家权重 FP4 存储、激活 FP8 计算。这套组合对国芯既是考验也是机会——稀疏注意力要新算子,但 KV 缓存被压到 V3.2 的十分之一,恰好补上国产 HBM 最缺的带宽。胜负手不在芯片本身,在那层 200 多个算子重写的「软件税」。
二、技术深潜:V4 的架构口味与国产芯片的适配成本
V4 是双模型家族:Pro 1.6T/49B 激活,Flash 284B/13B 激活,都支持 100 万 token 上下文 [A]。MoE 用 384 个路由专家加 1 个共享专家、top-6 路由。注意力从 MLA 升级成三层交叠的混合注意力:滑窗注意力(窗口 128)、压缩稀疏注意力 CSA(KV 沿序列 4:1 压缩后用 Lightning Indexer 挑 top-1024)、重度压缩注意力 HCA(128:1 压缩成全局摘要)。精度结构最关键:专家路径 FP4×FP8,KV 缓存混合 BF16/FP8,体积约为纯 BF16 的一半。
这套「内存口味」对国芯有利。1M context 推理的单 token FLOPs 只有 V3.2 的 27%、KV 缓存只有 V3.2 的 10%——国产 HBM 带宽本就落后一档(昇腾 950DT 4TB/s vs H200 约 4.8TB/s),KV 缓存缩到十分之一等于把最大短板削掉一截。这是我判断 V4 上国芯存在「架构级匹配机会」的核心依据 [D]。
但机会的另一面是算子债。CUDA 到 CANN 的迁移,公开口径约 200 个核心算子重写、十万级精度一致性测试、约 30 人年底层改造。自动翻译工具(msopgen、cann-translator 等)能处理简单 API,但对 __syncthreads()、__shfl_sync() 等线程束原语直接编译失败——CUDA 线程束调度是隐式确定的,昇腾 Cube 单元用显式指令级并行 [C]。最扎眼的是初始适配推理性能只有终版的 1/35,30 倍以上的优化空间靠人工内核抠回来 [B]。动态稀疏注意力(CSA/HCA)在 CANN 里没有原生算子,全靠 Ascend C 融合算子、TileLang-Ascend、PageAttention 调优等自定义内核。寒武纪走 vLLM Day-0(Flash 与 Pro 都开源),沐曦靠智源 FlagOS 加 KernelSwift。

上图:V4 的专家路由、稀疏注意力、低精度量化三个架构特征,最终都汇入「算子重写 + 精度测试」这条最贵的主线。
三、性能真相:厂商自测与独立验证之间,隔着一个不可信
厂商口径的数字很漂亮:昇腾 950 超节点跑 V4-Pro 单 token 生成延迟约 20ms、单卡并发 388 TPS;V4-Flash 低于 10ms、并发 4722 TPS。媒体还引用过「950PR 单卡是 H20 的 2.87 倍」。问题在于——全是厂商或伙伴自测,没有一家独立第三方复测过 [B]。MLPerf、MLCommons、NIST 复测,都没有针对 V4 在国产芯片上的实测。
而且厂商数字互相打架。同一个 V4-Pro,一个来源说单卡解码 4700 TPS,另一个说 388 TPS——对 49B 激活的解码路径,4700 TPS 物理上说不通,大概率是媒体把 Flash 和 Pro 弄混了。性能叙事还没经过「被市场核账」的过程。
相对可信的测量来自河套学院-哈工大(深圳)-华为联合团队:在超过 1000 片昇腾 910C 上完成 1.6T V4-Pro 全参数后训练(SFT+RL),MFU 超过 30%、1500 多步零系统中断 [B]。注意是后训练,不是预训练——论文没披露预训练硬件,媒体流传的「1.6T 在 910C 完成全训练」是单一来源,被更严谨的报道否定。
系统瓶颈也被量化:SLAI² 团队数据称 52.2% 的设备时间花在通信上,MoE 全对全通信是最大头 [B]。这说明工程量里,软件通信优化和硬件算子改写一样重——国产互连(灵衢2.0、UBoE)的带宽延迟,直接决定这 52% 能压到多少。

上图:从 4 月发布到 Q4 放量的时间线——技术适配与政策红线同步推进,Q4 昇腾 950 超节点是供给侧兑现点。
四、竞争格局:一张适配表,三种打法
「V4 上国芯」表面是八家芯片厂商的 Day-0 竞赛,实质是三种打法分化。
昇腾走「全栈共定义」:DeepSeek 与华为共同定义了超节点架构 [B]。950 系列双 die 分工——950PR(128GB HBM、约 1.6TB/s)主打推理与 prefill,950DT(144GB 自研 HBM、4TB/s 带宽、2TB/s 互连)主打训练与 decode。对 49B 激活的 decode 路径(内存带宽受限),950DT 的 4TB/s 是国产阵营里最合适的物理答案 [D]。
寒武纪走「生态白手套」:不做全栈,把 vLLM 适配做深,Flash 与 Pro 都开源。海光、沐曦、昆仑芯等是第三种:Day-0 声明适配,但公开细节最薄,大多停在推理侧,没有可核对的性能数字。
英伟达是「配给者」而非「退场者」:北京原则性批准 DeepSeek、字节、阿里、腾讯采购 H200,累计超 40 万颗,但条件严格到「实际一单都没下」——黄仁勋亲口确认没有正式订单 [B]。当 950DT 放量要等 Q4,H200 配额的实际执行率,是 V4 后续迭代节奏的隐藏变量。
| 玩家 | 打法 | 关键数据 | 瓶颈 |
|---|---|---|---|
| 华为昇腾 | 全栈共定义超节点 | 950DT 4TB/s 带宽;SuperPoD 最大 8192 卡 | 产能与交付节奏 |
| 寒武纪 | vLLM 深度适配 | Flash/Pro 双开源;Q1 预付款 18.97 亿 | 现金流与独立验证 |
| 海光/沐曦等 | Day-0 声明 + 工具链 | FlagOS/KernelSwift 等 | 无可核对性能数字 |
| 英伟达 | 配额配给者 | H200 原则批准 40 万+ 颗、实际 0 单 | 政策约束 |

上图:模型、芯片、需求三层生态的连接强度,决定了昇腾的全栈路线现阶段吃到了最多的订单。
五、市场与生态:政策红线与「买 token」的合流
最硬的变化是政策。7 月 15 日七部委行动方案设下硬红线:新增财政与央企自建算力,国产硬件采购占比不低于 75%,9 月 1 日生效、无过渡期 [B]。配合的是信通院 4 月 27 日启动的「DeepSeek-V4 国产化适配测试」(AISHPerf 基准,覆盖芯片、服务器、集群、框架,新增长序列、代码生成、Agent 成功率三个维度)[A]——这是官方给「适配真实性」建的验收通道,仍在进行中。
企业侧最强案例是中国石化与天翼云的「国云+国芯+国模」全栈部署,号称 100% 无外部依赖跑 V4-Pro。一个特别说明经济学问题的数据点:每日互动把 V4-Flash 压缩进一台华为 Atlas 800 八卡服务器,替代原来四台服务器、约 500 万元的集群——一台八卡国产服务器扛下一个 284B 模型,靠的就是 V4 的低激活率、低精度和 KV 压缩压下来的内存需求。
token 经济同步改写。V4-Pro 输出定价 24 元/百万 token,5 月 22 日永久降价 75%,缓存命中输入价压到 0.025 元。但 DeepSeek 自己的话信息量最大:「受限于高端算力,Pro 吞吐十分有限,预计下半年昇腾 950 超节点批量上市后价格大幅下调」[B]——官方把 Pro 的产能与价格,直接绑到昇腾 950 的放量节奏上。
六、战略启示与我的判断
对模型厂商:V4 证明了「为国产芯片做架构级适配」可行,但代价是 30 人年起步的软件税。Qwen、GLM、Kimi 会跟进——但跟进的是把模型架构改造成对国芯友好:低激活率、低精度、强 KV 压缩,将成为默认设计约束 [D]。这不是道德选择,是算力结构决定的。
对芯片厂商:昇腾领先不在单卡性能,而在「全栈共定义」——从算子到超节点到调度器联合设计,这是寒武纪们靠 vLLM 追不上的护城河。但所有国产厂商共同的软肋是「没有独立基准」——性能叙事一旦进入核账期,没第三方数据的一方会被动。
对采购方与投资者:政策红线把「买国产」变成合规项,但交付节奏才是真风险。盯三个硬数据:信通院 AISHPerf 适配测试结论、950DT 真实出货量、H200 配额执行率。在那之前,「全栈国产」是方向,不是现状。
我判断,「V4 上国芯」已经从「能不能」进入「值不值」——技术适配基本跑通,剩下的仗在软件成本摊薄与独立验证。我预判,未来六个月会出现第一份可信的独立第三方国产算力评测,信通院 AISHPerf 是最可能的发布渠道,厂商自测的漂亮数字会经历一次系统性打折。我原以为 950DT 量产会是训练侧国产化的拐点,但从 52.2% 的通信占比看,互连带宽才是下一个卡点——芯片算力到了,网络可能还没到。先不下结论:在独立基准出现之前,所有「快多少倍」都只是厂商口径。
参考来源(部分)
AI 辅助深度研究,人工视角解读。 每日更新。
更多推荐

所有评论(0)