训练类 vs 推理类硬件:一条生命周期主线

本文为《AI 硬件体系深度调研》系列第 03 篇。前两篇我们讲清了"AI 硬件是什么"和"为什么需要专用 AI 硬件",本篇开始沿着大模型的生命周期,把硬件划分为训练类推理类两大阵营,说清它们为何"不是一回事"。


黄金 100 字开头

你是否纳闷:同一个模型,训练时要几百张卡,上线后却只要几张? 很多人把训练和推理硬件混为一谈,结果要么浪费预算,要么撑不住流量。本文沿大模型生命周期主线,把训练类与推理类硬件的需求差异一次说清。


一、大模型的两阶段:训练与推理

任何大模型的一生,都可以粗暴地分成两段:先"学",再"用"

训练(Training),是模型"上学"的过程。你喂给它海量语料,它通过**反向传播(Backpropagation)**不断调整内部参数,直到能拟合出你想要的规律。这一阶段的特征是:计算量巨大、持续时间长、一次投入高。GPT 这类千亿参数模型,从头训练一次可能要烧掉几千万甚至上亿美元,跑几周甚至几个月。

推理(Inference),是模型"上班"的过程。训练完的模型部署上线,用户发来一句话,它做一次前向计算(Forward Pass),吐出结果。这一阶段的特征是:单次计算量小、但请求海量、必须低延迟。你手机上问一句"今天天气怎么样",背后就是一次推理。

这两段像极了人生:训练是寒窗苦读十几年,推理是毕业上班四十年。读书时你可以不计成本地投入时间,上班时每一秒都要产出、都要省电。硬件设计也一样——为了这两个截然不同的阶段,芯片走上了两条不同的路。

训练硬件的演进史,本身就是一部"算力饥渴史"。早年间训练靠 CPU,一个模型训几个月是常态;后来 GPU 靠大规模并行乘加,把时间压到几周;再往后,业界干脆为训练定制专用芯片,把矩阵运算、互联、内存带宽全部重做一遍。每一步演进,都是为了填平"模型想变强"和"硬件算不动"之间的鸿沟

⚠️ 避坑警告:这里千万别把"训练"理解成"只有大厂才需要"。任何公司做微调(Fine-tune)、做领域适配、甚至做小规模自研模型,都属于训练范畴,同样需要训练类硬件。

1.1 反向传播:训练为什么"吃"算力

训练的核心不是简单的前向计算,而是反向传播更新参数

想象你在调一个收音机的旋钮。前向计算就像"拧一下听听声音对不对",反向传播则是"根据声音偏差,反推每个旋钮该往哪边拧多少"。大模型的参数动辄几百亿,等于有几亿个旋钮要同时调,每一步都要算梯度、算误差、更新权重。

这套流程下来,计算量大概是单纯前向计算的 3 倍左右(前向 1 次 + 反向 1 次 + 权重更新 1 次),而且每一步都要求高精度——因为梯度是层层相乘的,一点精度误差会像复利一样被放大。

拿一个 70 亿参数(7B) 的小模型算笔账:它的权重矩阵里,仅一层就有上百万个参数,一次前向要做的矩阵乘法数量级在 10 亿次 MAC 以上。训练时这个数字还要乘 3——前向、反向、权重更新各来一遍。更关键的是,反向传播要算梯度,梯度又要乘权重,链式法则一层层展开,中间每一层的激活值都得存下来备用。这就是为什么训练吃显存:7B 模型的训练,光存中间激活值就可能吃掉几十 GB,再加上优化器状态,显存需求轻松突破百 GB。这还只是 7B,换成 700B 的模型,所有数字再乘 100。

再看一个更直观的时间账:一块旗舰训练卡,算力约 2PFLOPS(每秒 2 千万亿次浮点运算)。训一个 7B 模型,需要约 1 万亿 token 的数据,总计算量约 1e22 次浮点运算——单卡要跑 160 多年。所以哪怕你有 1000 张卡,也得跑两个月。这就是为什么训练总是"千卡起步":单卡的绝对性能再强,在"以年计"的训练任务面前也只是沧海一粟

1.2 前向计算:推理为什么"拼"响应

推理就简单多了。模型参数已经"冻住",用户输入进来,数据只往前走一遍,不做梯度、不更新权重,直接出结果。

但推理的难点在别处:你要同时服务成千上万个用户。每个人发一句话,你就得跑一遍前向。单次虽然轻,架不住量大。而且用户可没耐心——你超过 500 毫秒不吐字,他扭头就换别家

更微妙的是,推理请求是突发且不可预测的。白天上班高峰,问答接口可能一秒几千次调用;凌晨三点,可能只有个位数。硬件若按峰值配置,平时大部分时间空转浪费;若按平均配置,峰值一来又直接打挂。所以推理硬件还得能弹性伸缩、能动态调频——这又是和训练完全不同的设计诉求。


二、训练硬件:为"学"而生

训练类硬件,是给模型"上学"用的。它的设计逻辑,用一句话概括就是:不惜成本,把算力、带宽、协同拉满

2.1 需求一:高精度

训练里最怕精度崩塌

反向传播时,梯度信号从最后一层往回传,一层层相乘。如果每一层都损失一点点精度,传到第一层时可能已经面目全非。所以训练普遍用 FP16 / BF16 这样的半精度浮点——既比 FP32 快,又保留足够的动态范围。谁敢用 INT8 做训练,模型基本就废了

这就像做化学实验:推理是"量杯倒水,差不多就行",训练是"滴定管配试剂,差 0.1 毫升就炸"

实践中,训练还会用**混合精度(Mixed Precision)技巧:权重用 FP16 存,梯度累加用 FP32 兜底,再加一个损失缩放(Loss Scaling)**把过小的梯度放大,避免下溢。这套组合拳既吃到低精度带来的速度红利,又守住训练精度——但也说明训练对精度的敏感,已经到了需要专门机制来保护的地步。

举个精度崩塌的真实案例:早些年有团队为了加速训练,把某个中间层从 FP32 强行降到 FP16,结果训练跑了几天,loss 突然变成 NaN——梯度在几十层传递中不断下溢,最终归零。查了整整一周才定位到那一层的精度问题。训练精度的坑,往往是"跑着跑着才炸",等你发现时已经白跑了好几天

2.2 需求二:大带宽

训练要反复搬运权重、梯度、激活值、优化器状态四类数据。以千亿参数模型为例,仅优化器状态(Adam 类优化器要存一阶矩、二阶矩)就可能是权重本身的 2 倍

数据这么多,内存带宽跟不上,算力再猛也只能干等。这就是上一篇讲的内存墙。所以训练芯片标配 HBM(高带宽内存),单卡显存动辄 80GB 到 288GB,带宽 2.5TB/s 到 8TB/s——目的只有一个:让计算单元永远有活干,别饿着

具体算一下:一个 7B 模型,权重本身约 14GB(FP16),训练时还要存梯度和优化器状态,总显存轻松到 60-80GB。每一步迭代都要把这些数据从 HBM 读进片上缓存、算完再写回。如果带宽只有几百 GB/s,读一遍权重就要几十毫秒,而计算本身可能几毫秒就完了——算力利用率连 20% 都不到。把带宽拉到 8TB/s,数据才勉强喂得饱计算单元。

2.3 需求三:多卡协同

单张卡再猛,也扛不住千亿、万亿参数。所以训练必须多卡并联

但多卡不是"插上就行"。训练时每张卡算完一个 batch,都要和其他卡交换梯度(AllReduce),同步完才能进入下一步。如果卡与卡之间的"路"太窄,梯度传得慢,几千张卡就只能空转等通信

这就是为什么高端训练卡都带专属高速互联(如 NVLink 类技术),单链路带宽能达到 PCIe 的数倍甚至更高——训练看的不是单卡跑多快,而是几千张卡能不能像一张卡那样协同

以千卡集群为例:假设每张卡每秒要和其他卡交换 1GB 梯度,千卡集群每秒就是 1TB 的通信量。若走传统 PCIe(单链路约 64GB/s),光通信就会成为灾难性瓶颈,算力大半时间在等数据。所以训练互联讲究高带宽、低延迟、可扩展,甚至要用专门的拓扑(如环形、胖树)来缩短通信跳数。多卡训练的终极目标,是让通信开销在总时间里的占比降到个位数

2.4 训练硬件的典型画像

综合来看,训练芯片的典型参数是:

维度 典型值
精度 FP16 / BF16 为主
显存 80GB – 288GB(HBM3/E)
内存带宽 2.5TB/s – 8TB/s
芯片互联 专属高速直连,单链路可达 1.8TB/s
单卡功耗 300W – 500W
设计取向 高算力、高精度、高带宽、强协同

💡 效率技巧:判断一块卡是不是"训练卡",最快捷的方法就是看它的显存容量和卡间互联带宽——这两项越高,越偏训练。

展望未来,训练硬件的演进有几个确定方向:一是显存持续扩容,因为模型参数量还在以每年数倍的速度膨胀;二是互联带宽继续加码,从单机内互联走向跨机、跨机柜的统一通信;三是能效比被提到和算力同等重要的位置——毕竟训练一次几千万美元的电费和散热成本,正在倒逼芯片设计向更省电的方向演进。


三、推理硬件:为"用"而生

推理类硬件,是给模型"上班"用的。它的设计逻辑截然相反:够用就行,能省就省,越快越稳

3.1 需求一:低延迟

用户发一句话,期待的是秒回

推理的延迟瓶颈,通常不在"算得慢",而在"读得慢"。下一篇我们会讲 Decode 阶段——大模型每生成一个 token,都要把整个模型的权重从内存里读一遍。权重几百 GB,读一遍再快也要时间。

所以推理芯片的第一个任务不是"算得更快",而是让数据更快地流到计算单元。这就要靠更贴近计算的缓存、更大的片上 SRAM、更聪明的数据路径设计。

具体到延迟指标:用户对**首字延迟(TTFT, Time To First Token)**的容忍度大约在 500 毫秒以内,超过这个阈值,体感就明显变差。而大模型的 Decode 阶段每生成一个字都要读一遍权重,如果带宽不够,首字延迟直接飙到几秒,用户早跑了。所以低延迟的本质,不是把计算做快,而是把数据搬快

这里提前剧透一个关键结论:推理的两阶段里,Decode(逐字生成)才是真正的带宽杀手。Prefill 阶段要读一遍输入上下文,算得重但只做一次;Decode 阶段每吐一个字都要重读一遍全部权重,算得轻却要反复读。所以推理硬件对内存带宽的追求,和对峰值算力的追求,几乎同等重要——这一点下一篇会展开讲透。

3.2 需求二:低功耗

推理是长跑,不是冲刺。

训练卡 300-500W 的功耗,训练时忍一忍就过去了;但推理是 7×24 小时不间断运行,功耗直接变成电费账单。一台满载推理服务器,一年电费可能比硬件本身还贵。

所以推理芯片普遍把功耗压到 1W 到 100W 区间,靠的是缩小阵列规模、降低工作频率、动态关闭空闲单元同样是跑模型,训练卡像个火力全开的锅炉,推理卡像个会自己调档的变频空调

算一笔电费账:一块 400W 的训练卡,24 小时满载一年耗电约 3500 度;一块 50W 的推理卡,同样跑一年只耗约 440 度。如果数据中心里有十万张推理卡,这个功耗差一年就是 3 亿度电的差距——足够一个小城市用一阵子。推理的功耗控制,本质是在和电费表赛跑

除了电费,低功耗还带来一个隐形红利:部署更自由。高功耗训练卡需要专门的供电、散热、机房环境,而低功耗推理卡可以被塞进普通服务器、边缘网关,甚至嵌入摄像头、音箱这类终端设备里。功耗每降一档,可落地的场景就多一片——这才是推理硬件敢于"遍地开花"的底气。

3.3 需求三:低成本

推理要大规模铺量

训练卡一年可能就买几百张;推理卡是每个数据中心、每个边缘节点都要部署,采购量动辄几十万张。单卡成本每降 10%,整个部署成本就省出一个天文数字

所以推理芯片在精度上做"减法":既然不需要反向传播,就用 INT8 / FP8 低精度整数计算。同样的硅面积,低精度单元可以堆得更多、更省电,算力密度反而提升一倍以上

这又是一个反直觉的点:推理芯片的"低",恰恰是它的"强"。砍掉训练才需要的浮点精度,换来的不是缩水,而是单位硅面积、单位功耗下更高的有效吞吐。用更少的钱,服务更多的请求——这才是推理这门生意的底层逻辑。

这里展开讲一下量化(Quantization)的代价。把 FP16 权重压缩成 INT8,理论上吞吐翻倍、功耗减半,但精度会掉。好在推理不像训练那么娇贵——很多模型的推理结果对"差一点点"并不敏感,量化损失在可接受范围内。业界普遍用**量化感知训练(QAT)后训练量化(PTQ)**来把精度损失压到 1% 以内,同时享受低精度带来的速度和省电红利。推理低精度,是拿可量化的微小精度损失,去换巨大的效率收益

3.4 推理硬件的典型画像

维度 典型值
精度 INT8 / FP8 为主
显存 16GB – 80GB(HBM2e/HBM3)
功耗 1W – 100W
设计取向 低延迟、低功耗、低成本、高并发

⚠️ 避坑警告:不要看到"推理芯片算力低"就以为它差。推理的瓶颈在带宽不在算力峰值,一个带宽设计精良的推理芯片,实际吞吐可能甩开只堆算力的芯片几条街。

未来推理硬件的大方向是分层专用化:云端推理继续追求高并发下的极致性价比;边缘推理在 20-50W 区间平衡算力与带宽;端侧推理则要在手机、IoT 设备的几瓦预算里,跑出越来越大的模型。同是推理,云端、边缘、端侧三层的硬件设计已经逐渐分化出各自的路线,这也是本系列后续篇章会逐一展开的内容。


四、两者需求清单对比

把前面说的需求拉成一张表,差异一目了然:

对比维度 训练类硬件 推理类硬件
核心任务 反向传播,更新参数 前向计算,返回结果
精度需求 高精度(FP16/BF16) 低精度够用(INT8/FP8)
算力取向 算力峰值拉满 算力够用即可
内存带宽 超高(喂饱训练) 高(喂饱 Decode)
显存容量 大(80-288GB) 中(16-80GB)
协同需求 强(多卡梯度同步) 弱(单卡可独立服务)
功耗 高(300-500W) 低(1-100W)
成本 高(研发+部署) 低(规模铺量)
运行时长 短期高强度 长期持续在线

这张表背后是一条简单的道理:训练拼的是"峰值能力",推理拼的是"平均效率"

如果把这张表里的九项再压一层,你会发现它们全部指向同一个分水岭:训练是一次性重资产投入,推理是持续性运营成本。训练买卡、建集群、跑几个月,追求的是"尽快把模型训出来",所以它愿意为单点峰值能力砸钱;推理则是"模型上线后每天都要服务用户",所以它计较的是单位请求的功耗和成本。一个看短期爆发,一个看长期摊销,这才是训练与推理硬件分道扬镳的底层经济逻辑

用一个比喻收束:训练像造火箭,不计成本也要把推力拉满;推理像跑滴滴,每公里油耗和出车率才是命根子

再看这九行,其实可以再压成一句话:训练追求"一次算得又多又准",推理追求"长期算得又省又稳"。前者是爆发力,后者是耐力,从底层就注定了它们走不到一条路上。


五、为什么不能一颗芯片通吃

到这里,你可能要问:既然训练和推理都是做矩阵乘加,为什么不设计一颗芯片两个都干?

答案是:架构上的取舍是零和的

5.1 精度 vs 效率的不可兼得

训练要高精度(FP16/BF16),推理要低精度(INT8/FP8)。如果一颗芯片同时把两种精度单元都堆满,硅面积会暴增,既做不精训练,也省不出推理的功耗

就像一辆车:既要当 F1 赛车(高算力),又要当省油买菜车(低功耗),最后只能做成"啥都行、啥都不精"的平庸货

从硬件实现看,浮点乘加单元比整数乘加单元复杂得多、功耗高得多。一颗芯片若把浮点单元做成主力,推理时就是杀鸡用牛刀;若把整数单元做成主力,训练时精度又顶不住。这不是调调软件就能解决的事,而是晶体管预算怎么分配的根本矛盾。

5.2 协同 vs 独立的矛盾

训练需要多卡高速协同,推理则希望单卡独立、随插随用。为训练设计的复杂互联网络,对推理是纯浪费;为推理设计的精简接口,又撑不起训练的多卡同步。

互联硬件的成本不低:专属链路要占芯片面积、要耗电、要额外封装。训练卡愿意为这 1.8TB/s 的卡间直连买单,因为多卡协同是刚需;推理卡若也这么堆,单价和功耗就全崩了。反过来,推理卡省下的互联面积,正好用来放大片上缓存、优化数据路径。

更进一步,推理卡甚至可以通过**多实例并行(Multi-Instance)**把一颗大芯片切成多个独立小芯片,各自服务不同的请求,互不干扰。这种灵活性在训练场景里毫无意义——训练要的是所有算力拧成一股绳,而不是拆开单干。

5.3 功耗与散热的物理限制

300-500W 的训练卡,需要液冷、需要专门的机柜;1-100W 的推理卡,风冷甚至被动散热就能跑。把两种散热需求塞进同一颗芯片,设计难度和成本会指数级上升

散热的物理规律很残酷:功耗密度一旦超标,再好的架构也救不回来。训练卡可以待在恒温恒湿的机房里,配上冷板液冷;推理卡则可能被塞进狭小的边缘盒子,只能靠自然对流。这两种工作环境的温差、散热预算,从图纸阶段就决定了它们必须分开设计。

5.4 现实中的"折中"

当然,产业里确实存在一些"跨界选手"——有些推理芯片精度和算力上来了,能跑小规模微调;有些训练芯片优化了调度,也能兼做推理。但这个"兼"永远是有代价的要么牺牲一头的极致性能,要么付出不成比例的成本

所以产业界最通用的划分逻辑,依然是按任务生命周期分两类:训练归训练,推理归推理。认清这条主线,后面的芯片、加速卡、设备、终端各篇,你才不会看乱。

💡 效率技巧:选型时别被"训练推理两用"的营销话术带偏。先明确你的主战场是训练还是推理,再按对应的显存、带宽、功耗指标去卡,能省下大量冤枉钱。

举个真实的选型踩坑场景:某团队要上线一个对话模型,觉得"直接买训练卡,以后还能微调",于是采购了一批旗舰训练卡。结果上线后发现,推理高峰时卡间互联根本用不上,400W 的功耗电费却高得吓人,单卡成本还是推理专用芯片的 5 倍以上。反过来,也有团队图便宜买了纯推理卡,结果模型要小规模微调,精度和显存都顶不住,只能重新采购。先定生命周期阶段,再定硬件类型,能少交一半学费


配图

图 1:训练与推理两阶段流程图

flowchart LR
    subgraph 训练阶段
        A[海量语料] --> B[前向计算]
        B --> C[损失函数]
        C --> D[反向传播<br/>计算梯度]
        D --> E[更新参数]
        E --> B
    end

    subgraph 推理阶段
        F[用户请求] --> G[前向计算]
        G --> H[输出响应]
    end

    D -.->|高精度 FP16/BF16| I[大带宽<br/>多卡协同]
    G -.->|低精度 INT8/FP8| J[低延迟<br/>低功耗]

上图左侧是训练闭环:前向、反向、更新循环迭代;右侧是推理的"一线到底"。注意两者对精度、带宽、功耗的诉求方向完全相反。

图 2:训练 vs 推理 需求四象限对比图

quadrantChart
    title 训练 vs 推理 硬件需求定位
    x-axis 低功耗 --> 高算力
    y-axis 低带宽 --> 高带宽
    quadrant-1 训练芯片(高算力+高带宽)
    quadrant-2 训练芯片(高算力+高带宽)
    quadrant-3 推理芯片(低功耗+适中带宽)
    quadrant-4 推理芯片(低功耗+适中带宽)
    "训练芯片": [0.85, 0.85]
    "推理芯片": [0.35, 0.45]

训练芯片集中在右上角(高算力、高带宽),推理芯片集中在左下区域(低功耗、适中带宽)。两者在图上的位置,本质上是"峰值能力"与"平均效率"的分野。


写在最后

训练和推理,是大模型这枚硬币的两面。训练硬件用"高精度、大带宽、强协同"堆出峰值,推理硬件用"低延迟、低功耗、低成本"守住效率。理解这条主线,你再看后面的 AI 芯片、加速卡、智算中心,就有了坐标系。

最后把整篇压成一张随身卡片:训练=寒窗苦读,要的是"又快又准地学会";推理=毕业上班,要的是"又省又稳地服务"。前者拼峰值,后者拼平均;前者看单卡爆发力,后者看长期性价比。把这四句话记牢,无论后面遇到多少芯片型号、多少技术名词,你都能第一时间把它们归到正确的一边。


【思考题】

如果一个业务白天推理、晚上训练,能否用同一批卡分时复用?会遇到什么坑?(提示:想想精度切换、散热、软件栈适配、以及推理高峰与训练任务的资源抢占。)

【系列文章预告】

下一篇聚焦 AI 芯片本身——算力体系的最小核心单元到底长什么样,训练芯片和推理芯片的架构分野从何而来。


标签:训练硬件、推理硬件、反向传播、前向计算、大模型、AI基础设施、算力需求


训练=反向传播更新参数,推理=前向计算返回响应;训练类硬件核心需求为高精度、大带宽、大规模多卡协同,推理类硬件核心需求为低延迟、低功耗、低成本。

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐