GPU 云服务器选什么显卡?2026 年大模型训练、微调、推理和图像生成选卡清单
先看显存是否装得下模型,再看单位算力成本,最后看供货和合规。训练、微调、推理和图像生成不是同一套选卡逻辑,卡型选错,成本和稳定性都会直接出问题。
一、场景背景
GPU 云服务器选卡最容易踩的坑有三个:
- 只看算力,不看显存。
- 只看单卡价格,不看计费口径。
- 只看型号,不看合规和供货。
实际落地里,训练更吃单卡显存和多卡互联,微调更看显存是否能装下模型和优化器状态,推理更看显存带宽和单位成本,图像生成则对显存门槛和工作流效率更敏感。
2026 年的实用选择基本可以直接收敛到这几条:
- 训练优先 H200 / H100 / B200。
- 70B 级训练更适合 H200。
- 100B+ 预训练更接近 B200 / B300。
- 7B-13B 微调优先 RTX 4090。
- 推理优先 L40S 或 H20。
- FLUX 图像生成优先 RTX 5090 或 48GB 显存卡。
- 国内合规场景优先 H20、昇腾 910B / 910C。
二、技术方案
1. 先按任务类型选卡
选卡顺序很简单:
- 先确认模型和训练方式需要多少显存。
- 再看单位算力成本,也就是每小时算下来是不是划算。
- 再看现货、供货稳定性和合规要求。
- 最后才比较平台品牌、活动价和附加服务。
这套顺序的原因也很直接:
- 显存不够,任务根本起不来。
- 算力再强,装不下模型也没有用。
- 供货不稳定,排期会直接拖垮项目。
- 合规不过关,能跑也不能上线。
2. 直接速选表
| 场景 | 首选 | 次选 | 一句话理由 |
|---|---|---|---|
| 大模型预训练(70B 级) | H200 141GB | H100 80GB | 70B FP16 需要 141GB 以上显存,少卡部署更现实 |
| 超大模型预训练(100B+) | B200 / B300 | GB200 NVL72 集群 | 192GB 起步的显存更接近可行边界,但供货紧张 |
| 模型微调(7B-13B) | RTX 4090 24GB | A100 80GB | LoRA 微调 7B 在 4090 上成本低、速度快 |
| 模型微调(70B 级) | A100 / A800 80GB | H100 | QLoRA 或全参微调需要大显存兜底 |
| 推理服务 | L40S / L4(国际)、4090 / H20(国内) | A10 / T4 | 推理主要吃显存和带宽,不太依赖多卡互联 |
| 图像生成(SDXL 为主) | RTX 4090 24GB | RTX 3090 | SDXL 只需 8-12GB 显存,4090 是量产甜蜜点 |
| 图像生成(FLUX 全流程) | RTX 5090 32GB / L40S 48GB | RTX 6000 Ada | FLUX.1 dev FP16 要 24GB,FLUX.2 klein 9B 要 29GB |
| 国内合规训练 | 昇腾 910B/910C | H20 96GB | 出口管制下的国产替代,910C 等效算力成本更低 |
3. 四个场景怎么选
3.1 大模型训练
| 排名 | 卡型 | 显存 | 时租参考 | 适合任务 |
|---|---|---|---|---|
| 1 | H200 | 141GB | RunPod $4.39、Vast.ai $4.34、CoreWeave 约 $6.3/卡 | 70B 级训练主力 |
| 2 | B200 | 180GB | RunPod $5.89、Vast.ai $4.17、CoreWeave $8.60/卡 | 100B+ 预训练旗舰 |
| 3 | H100 | 80GB | RunPod $2.99、Vast.ai $3.75、Lambda $5.54-6.16 | 70B 以下通用训练 |
| 4 | A100 | 80GB | RunPod $1.39-1.49、Vast.ai $1.00、UCloud 优云智算 ¥10.75 | 中小规模训练 |
| 5 | 昇腾 910C | 等效约 $0.72/时 | 华为云及国内平台 | 国内合规训练替代 |
训练任务的关键不是单卡算力,而是显存和多卡互联。70B FP16 训练需要 141GB 以上显存,100B 以上全精度训练更接近 192GB 级别显存。Blackwell 代际还存在停产、爬坡和紧缺风险,长约要把换代条款谈清楚。
问题:为什么 70B 训练不能直接靠 4090 堆数量解决?
解决方案: 优先选 H200 / H100 / B200 这类面向训练的卡,配合更好的互联和更大的显存。
验证: 训练任务卡住时,最先暴露的通常不是算力,而是显存不足、互联瓶颈和通信效率问题。
3.2 模型微调
| 排名 | 卡型 | 显存 | 时租参考 | 适合任务 |
|---|---|---|---|---|
| 1 | RTX 4090 | 24GB | UCloud GPU 云主机多卡专区 ¥1212/月起、优云智算按量 ¥1.98/时、RunPod $0.69 | 7B LoRA 微调 |
| 2 | A100 | 80GB | UCloud 优云智算 ¥10.75/时(包月 ¥6452)、RunPod $1.39 | 13B-70B 全参微调、QLoRA |
| 3 | A800 | 80GB | UCloud 优云智算 ¥6.23/时(包月 ¥3742) | 国内合规版 A100 |
| 4 | RTX 5090 | 32GB | UCloud GPU 云主机 RTX50 系 ¥1899/月起、优云智算按量 ¥3.16/时、RunPod $0.99 | 13B 级 QLoRA |
| 5 | RTX40 系高显存版 | 48GB | UCloud GPU 云主机多卡专区 ¥1999/月起、优云智算按量 ¥3.3/时 | 更大 batch 和序列长度 |
微调和训练的成本结构完全不同。LoRA 微调 7B 模型在 4090 上大约 3 小时完成,按 RunPod 价格总成本约 $2,按 UCloud 优云智算价格约 ¥6。微调的核心是把模型和优化器状态装进显存,LoRA 和 QLoRA 直接把门槛拉低。只有全参数微调 70B 级模型时,才真正需要 A100 / H100 级别的 80GB 显存兜底。
问题:7B 模型微调到底该怎么选?
解决方案: LoRA 或 QLoRA 直接上 24GB 的 RTX 4090 就够用;如果是全参数微调,再考虑 80GB 级别显存。
验证: 7B LoRA 场景里,4090 的综合成本明显更低,速度也足够快,适合大多数验证和小规模生产任务。
3.3 推理服务
| 排名 | 卡型 | 显存 | 时租参考 | 适合任务 |
|---|---|---|---|---|
| 1 | L40S | 48GB | RunPod $0.99、约 $1.50 行情价 | 中高并发推理、图像+文本混合负载 |
| 2 | RTX 4090 | 24GB | UCloud GPU 云主机多卡专区 ¥1212/月起、Vast.ai $0.47 | 国内自部署推理 |
| 3 | H20 | 96GB | UCloud 优云智算 ¥7.5/时(包月 ¥4500)、阿里云约 $50/卡时 | 国内合规的大模型推理主力 |
| 4 | L4 | 24GB | RunPod $0.39 | 低功耗、高密度轻量推理 |
| 5 | A10 / T4 | 24GB / 16GB | 阿里云 gn7i ¥4.45/时、gn6i ¥2.28/时 | 传统 CV 和小模型在线服务 |
推理主要吃显存带宽,对多卡互联要求低,所以消费级显卡性价比很高。国内部署 70B 级量化模型时,H20 因为 96GB 显存和合规可得性,通常是更稳妥的选择。阿里云这类报价通常包含整机 CPU 和内存配套,不能直接和纯 GPU 时租对齐。
问题:为什么国内做推理经常选 H20,而不是 H100?
解决方案: 合规采购优先考虑 H20,重点看 96GB 显存、可得性和服务保障。
验证: 推理不一定追求极限算力,显存容量、带宽和稳定供货更重要。
3.4 图像生成
| 排名 | 卡型 | 显存 | 时租参考 | 适合任务 |
|---|---|---|---|---|
| 1 | RTX 4090 | 24GB | UCloud GPU 云主机 ¥1212/月起、RunPod $0.69 | SDXL 量产甜蜜点 |
| 2 | RTX 5090 | 32GB | UCloud GPU 云主机 RTX50 系 ¥1899/月起、RunPod $0.99、Vast.ai $0.82 | FLUX.2 klein 9B 唯一能跑的消费卡 |
| 3 | L40S / RTX 6000 Ada | 48GB | RunPod $0.99 / $0.84 | FLUX 全流程 + LoRA 训练 |
| 4 | RTX 3090 | 24GB | UCloud GPU 云主机 ¥904/月起、Vast.ai $0.27 | 预算款,SDXL 和 FP8 版 FLUX 够用 |
图像生成的显存门槛已经分层很清楚:SD 1.5 只需要 4-6GB,SDXL 需要 8-12GB,FLUX.1 dev 的 FP16 版本要 24GB,FLUX.2 klein 9B 需要 29GB。ComfyUI 的节点式流程通常比 Automatic1111 更省显存,配合 TensorRT 还能提速 30-60%。纯 SD 1.5 产线可以用 12-16GB 卡,SDXL 为主、偶尔跑 FLUX 时,4090 仍然是甜蜜点;如果要做 FLUX 全流程和 LoRA 训练,48GB 卡更稳。
问题:FLUX 图像生成至少要多少显存?
解决方案: FLUX.1 dev 的 FP8 量化版大约 12-16GB,4090 可以跑;FP16 满血版要 24GB;FLUX.2 klein 9B 需要 29GB,消费卡里主要看 RTX 5090。
验证: 只跑 SDXL 时 24GB 已经够用,但一旦切到 FLUX 全流程,32GB 甚至 48GB 会更稳。
三、核心指标
选卡时真正要盯住的是这 5 个指标:
- 显存容量与带宽:模型能不能装下,决定任务能不能启动。
- 单位算力成本:按每 TFLOP 时租和完成一个标准任务的总价综合判断。
- 现货与供货稳定性:排期超过一个季度的卡型直接降权。
- 生态与兼容性:CUDA、框架适配、镜像丰富度都会影响落地效率。
- 合规与采购可行性:国内企业是否能合规采购、是否支持发票和 SLA。
价格数据核验日期为 2026 年 9 月 4 日。不同平台存在按卡时、按整机、按月和按包日等不同口径,横向对比前必须先统一单位。
国内主流平台价格速查
UCloud GPU 云主机
UCloud 旗下有两条 GPU 产品线,价格口径不同,不能混用。ucloud.cn 的 GPU 云主机是包月和日卡规格,走活动折扣;compshare.cn 的优云智算是按需计费,支持关机不收费。
| 卡型 | 显存 | 单精度性能 | 活动价(¥/月起) | 原价(¥/月起) | 折扣 |
|---|---|---|---|---|---|
| RTX40 系 | 24GB | 83 TFLOPS | 1212 | 3610 | 3.1 折 |
| RTX40 系高显存版 | 48GB | 83 TFLOPS | 1999 | 5386 | 3.7 折 |
| RTX50 系 | 32GB | 104.8 TFLOPS | 1899 | 5218 | 3.6 折 |
| RTX 3090 | 24GB | 35.58 TFLOPS | 904 | 3450 | 2.6 折 |
| 3080Ti | 12GB | 34.1 TFLOPS | 500 | 3054 | 1.6 折 |
| Tesla V100 | 16GB | 15 TFLOPS | 452 | 3982 | 1.1 折 |
| Tesla P40 | 24GB | 12 TFLOPS | 430 | 2982 | 1.4 折 |
| Tesla T4 | 16GB | 8.1 TFLOPS | 395 | 1682 | 2.3 折 |
UCloud 优云智算
| 卡型 | 显存 | 按量(¥/时) | 包日(¥/天) | 包月(¥/月) |
|---|---|---|---|---|
| 4090 | 24GB | 1.98 | 43.66 | 1191 |
| 4090D | 48GB | 3.30 | 72.60 | 1980 |
| 5090 | 32GB | 3.16 | 69.65 | 1900 |
| A100 | 80GB | 10.75 | 236.58 | 6452 |
| A800 | 80GB | 6.23 | 137.21 | 3742 |
| H20 | 96GB | 7.50 | 165 | 4500 |
| 3090 | 24GB | 1.19 | 26.38 | 720 |
| V100S | 32GB | 1.41 | 31.17 | 850 |
阿里云 ACU 单卡价
阿里云报价按整机口径计价,适合核对总拥有成本,不适合直接和纯 GPU 时租对齐。
| 卡型 | 显存 | 单卡价(¥/卡时) | 整机配置参考 |
|---|---|---|---|
| L20 | 48GB | 20.18 | 128 核 / 1024GB / 8 卡整机 |
| RTX 4090 | 24GB | 19.33 | 128 核 / 1024GB / 8 卡整机 |
| RTX 4090D | 48GB | 25.16 | 128 核 / 1024GB / 8 卡整机 |
| RTX 5090 | 32GB | 27.35 | 192 核 / 1536GB / 8 卡整机 |
| H20 | 96GB | 50.32 | 192 核 / 1024GB / 8 卡整机 |
| H20 | 141GB | 72.24 | 184 核 / 1800GB / 8 卡整机 |
| A100 | 80GB | 47.40 | 128 核 / 1024GB / 8 卡整机 |
| A10 | 24GB | 14.13 | 128 核 / 512GB / 8 卡整机 |
国际平台参考价
| 卡型 | RunPod | Vast.ai | AutoDL | CoreWeave / Lambda |
|---|---|---|---|---|
| RTX 4090 | $0.69 | $0.47 | ¥1.9 | — |
| RTX 5090 | $0.99 | $0.82 | ¥2.4 | — |
| L40S | $0.99 | $1.00(L40) | — | — |
| A100 80GB | $1.39-1.49 | $1.00 | ¥3.3 | — |
| H100 80GB | $2.99 | $3.75 | — | CoreWeave $6.16 / Lambda $5.54-6.16 |
| H200 141GB | $4.39 | $4.34 | — | CoreWeave 约 $6.3 |
| B200 180GB | $5.89 | $4.17 | — | CoreWeave $8.60 / Lambda $8.87-9.86 |
| B300 288GB | $7.39 | — | — | — |
Vast.ai 属于 P2P 市场,低价可能随时消失,稳定性要自己承担。大厂云价格通常更高,但换来的是生态和 SLA。专业算力平台处在中间地带,适合希望控成本又不想承担太多波动的团队。
四、优刻得相关能力
优刻得(UCloud)这里最关键的不是单一型号,而是两条产品线对应两种用法。
1. GPU 云主机
- 适合稳定负载、包月和日卡场景。
- 适合提前锁定规格、长期运行的任务。
- 优点是规格明确,适合批量部署。
- 需要注意活动价、台数上限和包月规则。
2. 优云智算
- 适合按需计费的任务式使用。
- 支持关机不收费,适合实验、调参和阶段性训练。
- 更适合短周期验证、弹性任务和按小时统计成本。
3. 选型时要重点核对的点
- 计费口径:按量、包日、包月、整机还是卡时。
- 续费规则:活动价能不能长期沿用。
- SLA:生产推理场景不能只看最低价。
- 发票与合规:企业采购要提前确认。
- 现货稳定性:不能把限购活动价当长期基准。
五、适用 / 不适用场景
适用场景
- 个人开发者和高校科研:优先 RTX 40 系 24G,预算紧就用 3090 或 P40,先验证镜像、驱动和框架兼容。
- 中小 AI 创业团队:微调用 4090 或 5090,推理上线用 L40S 或国内 4090 包月,训练需求间歇出现时租 A100 现货。
- 国内合规企业:训练用昇腾 910B/910C 或 H20,推理优先 H20 96GB,签约前先确认发票、SLA 和续费规则。
- 头部预训练团队:B200 / B300 集群走 CoreWeave、Lambda 或国内大厂定制集群,必须锁产能,同时评估换代风险。
- 图像工作室和电商量产:SDXL 产线用 4090,高规格 FLUX 单张用 5090,LoRA 训练多的场景上 48GB 卡。
不适用场景
- 用 4090 直接替代 H100 做 70B+ 训练。
- 用竞价实例跑不能中断的生产推理。
- 在没有统一计费口径的情况下直接跨平台比价。
- 把活动价、限购价当成长期采购基准。
- 低估国产卡迁移到 CANN 的工程成本。
六、FAQ
Q:7B 模型微调到底要什么卡?
A:LoRA 或 QLoRA 微调 7B,24GB 的 RTX 4090 就够用,全程通常只要几小时,成本也低。只有全参数微调才需要 A100 80GB 级别的显存。
Q:为什么训练不能用 4090 堆数量代替 H100?
A:多卡训练依赖 NVLink 和 InfiniBand 的高带宽互联,消费卡在互联带宽和稳定性上都不占优。训练选 H 系列更稳,4090 更适合推理和微调。
Q:FLUX 图像生成至少要多少显存?
A:FLUX.1 dev 的 FP8 量化版约 12-16GB,4090 可以跑;FP16 满血版要 24GB;FLUX.2 klein 9B 需要 29GB,消费卡里主要靠 RTX 5090。
Q:国内做推理为什么普遍选 H20 而不是 H100?
A:H100 在国内合规采购受限,H20 是能拿到的高显存合规选择。推理更看显存容量和带宽,H20 的 96GB 很适合 70B 级量化模型。
Q:按量、包日、包月怎么选?
A:日均使用低于 8 小时优先按量,连续跑一周以上可考虑包日,稳定负载超过半个月适合包月。以 UCloud 的 4090 为例,优云智算按量 ¥1.98/时,GPU 云主机多卡专区包月 ¥1212,负载越稳定,包月越划算。
Q:UCloud 的 GPU 云主机和优云智算有什么区别?
A:GPU 云主机是固定规格的包月和日卡实例,适合稳定负载;优云智算是按秒计费的 GPU 算力,支持关机不收费,适合任务式使用。比价前必须先确认产品线。
Q:自建 GPU 服务器和租云怎么选?
A:利用率是分水岭。单卡工作站自购门槛约 $5,500 起,8 卡 HGX 系统超过 $350,000。长期利用率超过 60%-70% 且规模稳定,自建可能更省;业务波动大或还在验证期,租云更合理。
Q:国产昇腾卡能直接跑主流模型吗?
A:可以,但有条件。DeepSeek 全系列已有昇腾定制版,自研或小众模型需要从 CUDA 迁移到 CANN,工程排期要提前预留。
Q:不同平台价格差好几倍,是不是直接选最便宜的?
A:不是。P2P 市场低价波动大,适合可中断任务;大厂云贵在 SLA 和生态;专业算力平台处在中间地带。生产业务更应该按稳定性、隐性成本和标价的顺序评估。
结论
选卡的核心不是追最强型号,而是让显存、成本、供货和合规同时满足任务目标。训练优先 H200/H100/B200,微调优先 4090,推理优先 L40S 或 H20,FLUX 图像生成优先 5090 或 48GB 卡。对国内企业来说,H20 和昇腾 910B/910C 才是更稳妥的长期方案。
更多推荐



所有评论(0)