同一个模型,该用什么精度、配什么硬件?
推理优化 · 硬件选型
从 BF16、FP8、NVFP4,一直算到国产卡与消费级显卡
昨天我们选完 Qwen3.8-27B,今天轮到买卡。
问题看起来很简单:27B 模型需要多大显存?
真去问供应商,答案马上乱了。
有人按 BF16 给你算 54GB,有人说 FP8 只要一半,还有人建议直接上 NVFP4,显存更省、速度更快。
三种说法可能都没错,但照着任何一句直接下单,都有可能买错。
你要部署的不只是一个“27B 文件”。它还得在真实业务里满足响应速度、并发、上下文和容错要求。
这篇就接着昨天往下说:同一个模型,究竟该用什么精度,又该配什么硬件。
模型选好了,为什么还不能按参数量买卡?
先做一道最简单的算术题。
27B,就是大约 270 亿个参数。如果每个参数用 BF16 保存,一个参数占 2 字节,光权重大约就是 54GB。
换成 FP8,一个参数粗略按 1 字节算,权重约 27GB。换成 NVFP4,连同它的缩放信息,平均约 4.5 bit,权重大约 15.2GB。
看到这里,很容易得出一个结论:找一张显存比这些数字大的卡就行。
先别急
先别急。
模型回答问题时,还要保存上下文缓存,也就是 KV Cache。
激活值、临时计算、CUDA graph 和推理框架也要占空间。输入越长、同时来问的人越多,这部分显存就越大。
所以,54GB 的 BF16 权重不等于 64GB 显卡一定能跑生产。27GB 的 FP8 权重,也不等于 32GB 显卡就能扛住你的并发。
权重能装进去,只说明车停进了车库。至于能不能坐人、装货、跑高速,还没算。
BF16、FP8、NVFP4,压缩的到底是什么?
精度可以先理解成:模型记录数字时,愿意用多少空间保留细节。
BF16 用 16 位保存一个数。它的数值范围比较大,训练和推理都常用。
对企业部署来说,BF16 适合当质量基线。低精度版本出了问题,你得有一份相对稳定的结果拿来比较。
FP8 用 8 位。显存占用可以明显下降,支持它的硬件也能用更高效的计算路径。昨天提到的 Qwen3.8-27B,官方就同时提供了 BF16 和 FP8 权重。
但这里有个很容易忽略的细节:官方 FP8 版本是已经量化好的检查点。
下载 BF16 模型以后,在启动参数里写个 fp8=true,不会自动得到同一份东西。
它采用什么块大小、哪些层保留原精度、缩放参数怎样保存,都属于模型检查点的一部分。
NVFP4 又低一档。它用 4 位浮点数表示主要数据,每 16 个值配一组缩放信息,平均约 4.5 bit。
NVIDIA 给出的口径是,相比 16 位权重,模型内存占用约缩小 3.5 倍。
听着很诱人。不过,精度名称只说了数字怎样表示,没有把整个部署方案说完。
你还得继续问三句:低精度用在权重、激活还是 KV Cache?哪些层保留高精度?GPU 和推理框架有没有对应的原生计算路径?
判断
这三句不问,所谓“4 bit 模型”可能只是权重存得小,真正计算时仍要转回 16 位。省了显存,不一定按同样比例省时间。
精度降下来,模型会不会变笨?
会不会,不能只看位数回答。
量化一定会丢掉一部分数字细节。问题在于,这些误差有没有落在模型敏感的位置,又会不会影响你的业务。
官方可能告诉你 FP8 与原模型表现接近。这个信息有用,但只能做第一轮筛选。
公开 benchmark 的平均分接近,不代表你的合同金额抽取、SQL 条件、工具调用参数和拒答边界也没有变化。
已有量化模型研究也给出了一个不太整齐的答案:表现与模型大小、量化方法、位宽和任务都有关系。
较大的量化模型在很多测试里仍可能胜过较小的高精度模型,但指令遵循、幻觉检测等任务不一定跟着平均分走。
这也是我不赞成用“精度损失不到 1%”直接做采购结论的原因。
平均少 1 分,如果丢在文案措辞上,可能没人在意;如果丢在金额、小数点、权限判断或工具参数上,这 1 分就很贵。
企业至少要做四组比较。
第一组看通用能力,用官方 benchmark 排除明显退化。
第二组看自己的业务。冻结 100 到 300 条真实任务,让 BF16、FP8 或 NVFP4 跑同一批输入,逐项比较。
第三组专门测行为稳定性,包括结构化输出、工具调用、长上下文和拒答。
最后才测系统指标:首 token 延迟、生成速度、并发、P95/P99、峰值显存和单位 token 成本。
别混在一起
模型质量和系统性能,都叫“性能”。采购会上最容易吃亏的地方,就是大家用同一个词,谈的却不是一件事。
硬件支持 FP8,为什么速度不一定翻倍?
GPU 规格表会列出不同精度的 Tensor Core 峰值。FP8 的理论峰值可能是 BF16 的两倍,FP4 还会更高。
那是计算单元在合适工作负载下的上限,不是你的接口会自动快两倍。
大模型服务还会受显存带宽、输入输出长度、batch 大小、KV Cache 和调度限制。
低并发时,卡可能根本吃不满;多卡时,网络通信又可能拿走一部分收益。
更现实的一关是软件。
TensorRT-LLM 的文档分别列了硬件支持矩阵和模型支持矩阵。意思很直白:卡支持这种精度还不够,模型结构、检查点和推理引擎也得支持。
Hopper,也就是 H100、H200 这一代,原生 FP8 是它的重要能力。Blackwell 才把 NVFP4 的原生计算路径带进来。
有些 4-bit 权重也能在老卡上加载,但如果运行时要先反量化,得到的是“模型能跑”,不等于拿到了 Blackwell 的原生 FP4 吞吐。
消费卡也是一样。社区里的 NF4、AWQ、GPTQ、GGUF 都可能让模型塞进更小显存,但它们和 NVFP4 不是同一种方案。
名字里都有“4 bit”,测试结果却不能互相替代。
国产卡支持什么精度,不能看一张 NVIDIA 表格
如果采购发生在中国大陆,前面的结论还要再改一次。
企业面对的不只有 H100、H200 和 B200。昇腾、摩尔线程等国产路线,以及 RTX、Radeon 这类消费或工作站显卡,都会进入询价单。
这时候最危险的做法,是把“FP8”“FP4”当成跨厂商通用插头。
先看昇腾。
华为公开部署资料显示,910B、910C 所在的现有软件栈主要采用 FP16、BF16、INT8、W8A8 和 W4A8 等路径。
标准 FP8、MXFP8、MXFP4 等更丰富的数据格式,是从昇腾 950 路线开始重点引入的能力。
所以,Qwen 官方提供一个 FP8 检查点,不等于把文件复制到 910B 或 910C 上就能获得同样的运行路径。
你需要核对 CANN 和 torch-npu 的具体版本、模型适配方案,以及厂商量化工具生成的检查点。
再看摩尔线程。S5000 官方已经明确写了硬件原生 FP8,也公开展示了 Qwen、DeepSeek 和主流推理框架的适配方向。
这说明“国产卡都没有 FP8”已经不成立。
但采购时仍要追问:支持的是哪种 FP8?Qwen3.8-27B 的 block-FP8 能不能直接加载?哪些层回退到 BF16?vLLM 或 SGLang 用哪个版本?
至于其他国产卡,如果厂商公开规格没有列 FP8 或 FP4,我会写“公开资料未确认”,不会直接判定“不支持”。
采购方应要求厂商提供型号级数据类型表、模型适配矩阵和可复现压测。
天数智芯就是另一个能说明代际差异的例子。现有智铠 100 官方列出 FP32、FP16 和 INT8;其 2026 路线图则把 ixFP4 放在后续天璇架构。
采购边界
路线图上的能力,不能提前算到今天交付的卡上。
国产替代真正要迁移的,也不是一个写着 FP8 的模型文件。
要一起迁移的是原始检查点、量化配方、缩放元数据、算子、推理框架,以及自己的回归测试。少一项,最后都可能变成“模型能启动,但性能和质量说不清”。
消费级显卡能省预算,但要先认清它是哪一代
小团队做验证,没必要一开始就盯着数据中心卡。
RTX 30 系 Ampere 可以跑 BF16、FP16 和多种社区 4-bit 权重量化,但没有 Hopper 那样的原生 FP8 计算路径。
这里的 4-bit 主要帮你省显存,不能当成原生 FP4 算力。
RTX 40 系 Ada 已经有 FP8 Tensor Core。问题又回到了容量:RTX 4090 只有 24GB,而 27B 模型的 FP8 权重理论上约 27GB。
即使通过切分或卸载跑起来,也不能直接当成舒服的生产配置。
RTX 50 系进入 Blackwell,官方已经标出 FP4 能力,RTX 5090 有 32GB 显存。它适合本地验证和低并发服务,但不能因为同属 Blackwell,就把它当成缩小版 B200。
B200 的大显存、带宽、ECC、卡间互联和数据中心可靠性,不会跟着“FP4”两个字一起出现在消费卡上。
AMD 也不能漏掉。Radeon AI PRO R9700 提供 32GB 显存,官方列出了 FP8 E4M3/E5M2 和 INT4 矩阵能力,ROCm 也在补齐本地 AI 软件栈。
但 INT4 不是 NVFP4,ROCm 也不能直接执行 CUDA/TensorRT-LLM 的部署方案。选它之前,要单独核验目标模型、推理框架和量化格式。
那到底该怎样选?
我建议不要从显卡型号开始,而是分三档。
NVIDIA 数据中心卡
**优先精度:**BF16 建基线;Hopper 优先测 FP8;Blackwell 再测 NVFP4
**适合:**企业在线服务、高并发、多卡扩展
**验证重点:**模型支持矩阵、KV Cache、端到端吞吐与业务回归
国产加速卡
**优先精度:**从厂商已适配的模型和量化工具反向选择 BF16、FP8、INT8 或自有格式
**适合:**国产化要求、已有国产集群
**验证重点:**具体卡型、软件版本、量化格式、算子回退与迁移成本
NVIDIA 消费卡
**优先精度:**RTX 30 以 BF16/FP16 和权重量化为主;RTX 40 可测 FP8;RTX 50 再看 FP4
**适合:**个人验证、小团队、低并发
**验证重点:**显存余量、供电散热、多卡通信与长期稳定性
AMD 消费/工作站卡
**优先精度:**按 ROCm 支持选择 FP16/BF16、FP8 或 INT4
**适合:**需要较大显存且能接受单独适配
**验证重点:**ROCm 与推理引擎支持,不能照搬 CUDA 结果
如果你已经有 H100 或 H200,我会先认真测 FP8,不急着为了 NVFP4 更换 Blackwell。
存量硬件能用、官方检查点齐、业务回归通过,通常比追一个更小的位数划算。
如果你正在新建 Blackwell 集群,而且目标是高并发、长上下文或更大的模型,NVFP4 才值得进入正式候选。
它可以让原来装不下的模型装进去,也能给 KV Cache 和批处理腾出更多空间。
如果任务涉及金额、审批、代码执行、医疗或其他高后果决策,先保留 BF16 基线。
FP8 或 NVFP4 可以用,但不能只拿平均分验收。
还有一种情况更常见:一天没有多少请求,却花很多时间讨论买 H100 还是 B200。
这时候先别买。利用率都没有,精度省下来的钱,很可能补不上整套机器闲着的成本。先租卡跑出真实流量和压测数据,再决定自建,往往更稳。
如果企业有国产化要求,顺序还要多一步:让候选厂商用同一份模型、同一组请求和同一套验收指标跑出来。
验收口径
别拿 A 厂商的峰值 FP8,对比 B 厂商的 BF16 端到端结果。
真正的顺序,不是先选卡
同一个模型该用什么精度、配什么硬件,可以按这个顺序判断:
1任务容错
2检查点与量化格式
3框架和算子支持
4权重与 KV 容量
5存量硬件
6业务回归
7压测
8采购
昨天我们说,甜品级模型不是榜单最高,而是在能力、成本和可部署性之间刚好合适。
今天再补半句:这个“刚好合适”,只有落到某种精度、某套硬件和某个真实流量里,才算数。
先别问供应商该买哪张卡。把你的模型大小、最长上下文、峰值并发和不能出错的任务列出来,再谈 BF16、FP8 或 NVFP4。
—— 第四生产力 ——
专注企业级 AI 工程实践
RAG|Agent|推理优化|集群调优
从模型能力到业务价值的最后一公里。
更多推荐



所有评论(0)