推理优化 · 硬件选型

从 BF16、FP8、NVFP4,一直算到国产卡与消费级显卡

昨天我们选完 Qwen3.8-27B,今天轮到买卡。

问题看起来很简单:27B 模型需要多大显存?

真去问供应商,答案马上乱了。

有人按 BF16 给你算 54GB,有人说 FP8 只要一半,还有人建议直接上 NVFP4,显存更省、速度更快。

三种说法可能都没错,但照着任何一句直接下单,都有可能买错。

你要部署的不只是一个“27B 文件”。它还得在真实业务里满足响应速度、并发、上下文和容错要求。

这篇就接着昨天往下说:同一个模型,究竟该用什么精度,又该配什么硬件。

模型选好了,为什么还不能按参数量买卡?

先做一道最简单的算术题。

27B,就是大约 270 亿个参数。如果每个参数用 BF16 保存,一个参数占 2 字节,光权重大约就是 54GB。

换成 FP8,一个参数粗略按 1 字节算,权重约 27GB。换成 NVFP4,连同它的缩放信息,平均约 4.5 bit,权重大约 15.2GB。

看到这里,很容易得出一个结论:找一张显存比这些数字大的卡就行。

先别急

先别急。

模型回答问题时,还要保存上下文缓存,也就是 KV Cache。

激活值、临时计算、CUDA graph 和推理框架也要占空间。输入越长、同时来问的人越多,这部分显存就越大。

所以,54GB 的 BF16 权重不等于 64GB 显卡一定能跑生产。27GB 的 FP8 权重,也不等于 32GB 显卡就能扛住你的并发。

权重能装进去,只说明车停进了车库。至于能不能坐人、装货、跑高速,还没算。

BF16、FP8、NVFP4,压缩的到底是什么?

精度可以先理解成:模型记录数字时,愿意用多少空间保留细节。

BF16 用 16 位保存一个数。它的数值范围比较大,训练和推理都常用。

对企业部署来说,BF16 适合当质量基线。低精度版本出了问题,你得有一份相对稳定的结果拿来比较。

FP8 用 8 位。显存占用可以明显下降,支持它的硬件也能用更高效的计算路径。昨天提到的 Qwen3.8-27B,官方就同时提供了 BF16 和 FP8 权重。

但这里有个很容易忽略的细节:官方 FP8 版本是已经量化好的检查点。

下载 BF16 模型以后,在启动参数里写个 fp8=true,不会自动得到同一份东西。

它采用什么块大小、哪些层保留原精度、缩放参数怎样保存,都属于模型检查点的一部分。

NVFP4 又低一档。它用 4 位浮点数表示主要数据,每 16 个值配一组缩放信息,平均约 4.5 bit。

NVIDIA 给出的口径是,相比 16 位权重,模型内存占用约缩小 3.5 倍。

听着很诱人。不过,精度名称只说了数字怎样表示,没有把整个部署方案说完。

你还得继续问三句:低精度用在权重、激活还是 KV Cache?哪些层保留高精度?GPU 和推理框架有没有对应的原生计算路径?

判断

这三句不问,所谓“4 bit 模型”可能只是权重存得小,真正计算时仍要转回 16 位。省了显存,不一定按同样比例省时间。

精度降下来,模型会不会变笨?

会不会,不能只看位数回答。

量化一定会丢掉一部分数字细节。问题在于,这些误差有没有落在模型敏感的位置,又会不会影响你的业务。

官方可能告诉你 FP8 与原模型表现接近。这个信息有用,但只能做第一轮筛选。

公开 benchmark 的平均分接近,不代表你的合同金额抽取、SQL 条件、工具调用参数和拒答边界也没有变化。

已有量化模型研究也给出了一个不太整齐的答案:表现与模型大小、量化方法、位宽和任务都有关系。

较大的量化模型在很多测试里仍可能胜过较小的高精度模型,但指令遵循、幻觉检测等任务不一定跟着平均分走。

这也是我不赞成用“精度损失不到 1%”直接做采购结论的原因。

平均少 1 分,如果丢在文案措辞上,可能没人在意;如果丢在金额、小数点、权限判断或工具参数上,这 1 分就很贵。

企业至少要做四组比较。

第一组看通用能力,用官方 benchmark 排除明显退化。

第二组看自己的业务。冻结 100 到 300 条真实任务,让 BF16、FP8 或 NVFP4 跑同一批输入,逐项比较。

第三组专门测行为稳定性,包括结构化输出、工具调用、长上下文和拒答。

最后才测系统指标:首 token 延迟、生成速度、并发、P95/P99、峰值显存和单位 token 成本。

别混在一起

模型质量和系统性能,都叫“性能”。采购会上最容易吃亏的地方,就是大家用同一个词,谈的却不是一件事。

硬件支持 FP8,为什么速度不一定翻倍?

GPU 规格表会列出不同精度的 Tensor Core 峰值。FP8 的理论峰值可能是 BF16 的两倍,FP4 还会更高。

那是计算单元在合适工作负载下的上限,不是你的接口会自动快两倍。

大模型服务还会受显存带宽、输入输出长度、batch 大小、KV Cache 和调度限制。

低并发时,卡可能根本吃不满;多卡时,网络通信又可能拿走一部分收益。

更现实的一关是软件。

TensorRT-LLM 的文档分别列了硬件支持矩阵和模型支持矩阵。意思很直白:卡支持这种精度还不够,模型结构、检查点和推理引擎也得支持。

Hopper,也就是 H100、H200 这一代,原生 FP8 是它的重要能力。Blackwell 才把 NVFP4 的原生计算路径带进来。

有些 4-bit 权重也能在老卡上加载,但如果运行时要先反量化,得到的是“模型能跑”,不等于拿到了 Blackwell 的原生 FP4 吞吐。

消费卡也是一样。社区里的 NF4、AWQ、GPTQ、GGUF 都可能让模型塞进更小显存,但它们和 NVFP4 不是同一种方案。

名字里都有“4 bit”,测试结果却不能互相替代。

国产卡支持什么精度,不能看一张 NVIDIA 表格

如果采购发生在中国大陆,前面的结论还要再改一次。

企业面对的不只有 H100、H200 和 B200。昇腾、摩尔线程等国产路线,以及 RTX、Radeon 这类消费或工作站显卡,都会进入询价单。

这时候最危险的做法,是把“FP8”“FP4”当成跨厂商通用插头。

先看昇腾。

华为公开部署资料显示,910B、910C 所在的现有软件栈主要采用 FP16、BF16、INT8、W8A8 和 W4A8 等路径。

标准 FP8、MXFP8、MXFP4 等更丰富的数据格式,是从昇腾 950 路线开始重点引入的能力。

所以,Qwen 官方提供一个 FP8 检查点,不等于把文件复制到 910B 或 910C 上就能获得同样的运行路径。

你需要核对 CANN 和 torch-npu 的具体版本、模型适配方案,以及厂商量化工具生成的检查点。

再看摩尔线程。S5000 官方已经明确写了硬件原生 FP8,也公开展示了 Qwen、DeepSeek 和主流推理框架的适配方向。

这说明“国产卡都没有 FP8”已经不成立。

但采购时仍要追问:支持的是哪种 FP8?Qwen3.8-27B 的 block-FP8 能不能直接加载?哪些层回退到 BF16?vLLM 或 SGLang 用哪个版本?

至于其他国产卡,如果厂商公开规格没有列 FP8 或 FP4,我会写“公开资料未确认”,不会直接判定“不支持”。

采购方应要求厂商提供型号级数据类型表、模型适配矩阵和可复现压测。

天数智芯就是另一个能说明代际差异的例子。现有智铠 100 官方列出 FP32、FP16 和 INT8;其 2026 路线图则把 ixFP4 放在后续天璇架构。

采购边界

路线图上的能力,不能提前算到今天交付的卡上。

国产替代真正要迁移的,也不是一个写着 FP8 的模型文件。

要一起迁移的是原始检查点、量化配方、缩放元数据、算子、推理框架,以及自己的回归测试。少一项,最后都可能变成“模型能启动,但性能和质量说不清”。

消费级显卡能省预算,但要先认清它是哪一代

小团队做验证,没必要一开始就盯着数据中心卡。

RTX 30 系 Ampere 可以跑 BF16、FP16 和多种社区 4-bit 权重量化,但没有 Hopper 那样的原生 FP8 计算路径。

这里的 4-bit 主要帮你省显存,不能当成原生 FP4 算力。

RTX 40 系 Ada 已经有 FP8 Tensor Core。问题又回到了容量:RTX 4090 只有 24GB,而 27B 模型的 FP8 权重理论上约 27GB。

即使通过切分或卸载跑起来,也不能直接当成舒服的生产配置。

RTX 50 系进入 Blackwell,官方已经标出 FP4 能力,RTX 5090 有 32GB 显存。它适合本地验证和低并发服务,但不能因为同属 Blackwell,就把它当成缩小版 B200。

B200 的大显存、带宽、ECC、卡间互联和数据中心可靠性,不会跟着“FP4”两个字一起出现在消费卡上。

AMD 也不能漏掉。Radeon AI PRO R9700 提供 32GB 显存,官方列出了 FP8 E4M3/E5M2 和 INT4 矩阵能力,ROCm 也在补齐本地 AI 软件栈。

但 INT4 不是 NVFP4,ROCm 也不能直接执行 CUDA/TensorRT-LLM 的部署方案。选它之前,要单独核验目标模型、推理框架和量化格式。

那到底该怎样选?

我建议不要从显卡型号开始,而是分三档。

NVIDIA 数据中心卡

**优先精度:**BF16 建基线;Hopper 优先测 FP8;Blackwell 再测 NVFP4

**适合:**企业在线服务、高并发、多卡扩展

**验证重点:**模型支持矩阵、KV Cache、端到端吞吐与业务回归

国产加速卡

**优先精度:**从厂商已适配的模型和量化工具反向选择 BF16、FP8、INT8 或自有格式

**适合:**国产化要求、已有国产集群

**验证重点:**具体卡型、软件版本、量化格式、算子回退与迁移成本

NVIDIA 消费卡

**优先精度:**RTX 30 以 BF16/FP16 和权重量化为主;RTX 40 可测 FP8;RTX 50 再看 FP4

**适合:**个人验证、小团队、低并发

**验证重点:**显存余量、供电散热、多卡通信与长期稳定性

AMD 消费/工作站卡

**优先精度:**按 ROCm 支持选择 FP16/BF16、FP8 或 INT4

**适合:**需要较大显存且能接受单独适配

**验证重点:**ROCm 与推理引擎支持,不能照搬 CUDA 结果

如果你已经有 H100 或 H200,我会先认真测 FP8,不急着为了 NVFP4 更换 Blackwell。

存量硬件能用、官方检查点齐、业务回归通过,通常比追一个更小的位数划算。

如果你正在新建 Blackwell 集群,而且目标是高并发、长上下文或更大的模型,NVFP4 才值得进入正式候选。

它可以让原来装不下的模型装进去,也能给 KV Cache 和批处理腾出更多空间。

如果任务涉及金额、审批、代码执行、医疗或其他高后果决策,先保留 BF16 基线。

FP8 或 NVFP4 可以用,但不能只拿平均分验收。

还有一种情况更常见:一天没有多少请求,却花很多时间讨论买 H100 还是 B200。

这时候先别买。利用率都没有,精度省下来的钱,很可能补不上整套机器闲着的成本。先租卡跑出真实流量和压测数据,再决定自建,往往更稳。

如果企业有国产化要求,顺序还要多一步:让候选厂商用同一份模型、同一组请求和同一套验收指标跑出来。

验收口径

别拿 A 厂商的峰值 FP8,对比 B 厂商的 BF16 端到端结果。

真正的顺序,不是先选卡

同一个模型该用什么精度、配什么硬件,可以按这个顺序判断:

1任务容错

2检查点与量化格式

3框架和算子支持

4权重与 KV 容量

5存量硬件

6业务回归

7压测

8采购

昨天我们说,甜品级模型不是榜单最高,而是在能力、成本和可部署性之间刚好合适。

今天再补半句:这个“刚好合适”,只有落到某种精度、某套硬件和某个真实流量里,才算数。

先别问供应商该买哪张卡。把你的模型大小、最长上下文、峰值并发和不能出错的任务列出来,再谈 BF16、FP8 或 NVFP4。

—— 第四生产力 ——

专注企业级 AI 工程实践

RAG|Agent|推理优化|集群调优

从模型能力到业务价值的最后一公里。

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐