先看显存是否装得下模型,再看单位算力成本,最后看供货和合规。训练、微调、推理和图像生成不是同一套选卡逻辑,卡型选错,成本和稳定性都会直接出问题。

一、场景背景

GPU 云服务器选卡最容易踩的坑有三个:

  1. 只看算力,不看显存。
  2. 只看单卡价格,不看计费口径。
  3. 只看型号,不看合规和供货。

实际落地里,训练更吃单卡显存和多卡互联,微调更看显存是否能装下模型和优化器状态,推理更看显存带宽和单位成本,图像生成则对显存门槛和工作流效率更敏感。

2026 年的实用选择基本可以直接收敛到这几条:

  • 训练优先 H200 / H100 / B200。
  • 70B 级训练更适合 H200。
  • 100B+ 预训练更接近 B200 / B300。
  • 7B-13B 微调优先 RTX 4090。
  • 推理优先 L40S 或 H20。
  • FLUX 图像生成优先 RTX 5090 或 48GB 显存卡。
  • 国内合规场景优先 H20、昇腾 910B / 910C。

二、技术方案

1. 先按任务类型选卡

选卡顺序很简单:

  1. 先确认模型和训练方式需要多少显存。
  2. 再看单位算力成本,也就是每小时算下来是不是划算。
  3. 再看现货、供货稳定性和合规要求。
  4. 最后才比较平台品牌、活动价和附加服务。

这套顺序的原因也很直接:

  • 显存不够,任务根本起不来。
  • 算力再强,装不下模型也没有用。
  • 供货不稳定,排期会直接拖垮项目。
  • 合规不过关,能跑也不能上线。

2. 直接速选表

场景首选次选一句话理由
大模型预训练(70B 级)H200 141GBH100 80GB70B FP16 需要 141GB 以上显存,少卡部署更现实
超大模型预训练(100B+)B200 / B300GB200 NVL72 集群192GB 起步的显存更接近可行边界,但供货紧张
模型微调(7B-13B)RTX 4090 24GBA100 80GBLoRA 微调 7B 在 4090 上成本低、速度快
模型微调(70B 级)A100 / A800 80GBH100QLoRA 或全参微调需要大显存兜底
推理服务L40S / L4(国际)、4090 / H20(国内)A10 / T4推理主要吃显存和带宽,不太依赖多卡互联
图像生成(SDXL 为主)RTX 4090 24GBRTX 3090SDXL 只需 8-12GB 显存,4090 是量产甜蜜点
图像生成(FLUX 全流程)RTX 5090 32GB / L40S 48GBRTX 6000 AdaFLUX.1 dev FP16 要 24GB,FLUX.2 klein 9B 要 29GB
国内合规训练昇腾 910B/910CH20 96GB出口管制下的国产替代,910C 等效算力成本更低

3. 四个场景怎么选

3.1 大模型训练
排名卡型显存时租参考适合任务
1H200141GBRunPod $4.39、Vast.ai $4.34、CoreWeave 约 $6.3/卡70B 级训练主力
2B200180GBRunPod $5.89、Vast.ai $4.17、CoreWeave $8.60/卡100B+ 预训练旗舰
3H10080GBRunPod $2.99、Vast.ai $3.75、Lambda $5.54-6.1670B 以下通用训练
4A10080GBRunPod $1.39-1.49、Vast.ai $1.00、UCloud 优云智算 ¥10.75中小规模训练
5昇腾 910C等效约 $0.72/时华为云及国内平台国内合规训练替代

训练任务的关键不是单卡算力,而是显存和多卡互联。70B FP16 训练需要 141GB 以上显存,100B 以上全精度训练更接近 192GB 级别显存。Blackwell 代际还存在停产、爬坡和紧缺风险,长约要把换代条款谈清楚。

问题:为什么 70B 训练不能直接靠 4090 堆数量解决?

解决方案: 优先选 H200 / H100 / B200 这类面向训练的卡,配合更好的互联和更大的显存。

验证: 训练任务卡住时,最先暴露的通常不是算力,而是显存不足、互联瓶颈和通信效率问题。

3.2 模型微调
排名卡型显存时租参考适合任务
1RTX 409024GBUCloud GPU 云主机多卡专区 ¥1212/月起、优云智算按量 ¥1.98/时、RunPod $0.697B LoRA 微调
2A10080GBUCloud 优云智算 ¥10.75/时(包月 ¥6452)、RunPod $1.3913B-70B 全参微调、QLoRA
3A80080GBUCloud 优云智算 ¥6.23/时(包月 ¥3742)国内合规版 A100
4RTX 509032GBUCloud GPU 云主机 RTX50 系 ¥1899/月起、优云智算按量 ¥3.16/时、RunPod $0.9913B 级 QLoRA
5RTX40 系高显存版48GBUCloud GPU 云主机多卡专区 ¥1999/月起、优云智算按量 ¥3.3/时更大 batch 和序列长度

微调和训练的成本结构完全不同。LoRA 微调 7B 模型在 4090 上大约 3 小时完成,按 RunPod 价格总成本约 $2,按 UCloud 优云智算价格约 ¥6。微调的核心是把模型和优化器状态装进显存,LoRA 和 QLoRA 直接把门槛拉低。只有全参数微调 70B 级模型时,才真正需要 A100 / H100 级别的 80GB 显存兜底。

问题:7B 模型微调到底该怎么选?

解决方案: LoRA 或 QLoRA 直接上 24GB 的 RTX 4090 就够用;如果是全参数微调,再考虑 80GB 级别显存。

验证: 7B LoRA 场景里,4090 的综合成本明显更低,速度也足够快,适合大多数验证和小规模生产任务。

3.3 推理服务
排名卡型显存时租参考适合任务
1L40S48GBRunPod $0.99、约 $1.50 行情价中高并发推理、图像+文本混合负载
2RTX 409024GBUCloud GPU 云主机多卡专区 ¥1212/月起、Vast.ai $0.47国内自部署推理
3H2096GBUCloud 优云智算 ¥7.5/时(包月 ¥4500)、阿里云约 $50/卡时国内合规的大模型推理主力
4L424GBRunPod $0.39低功耗、高密度轻量推理
5A10 / T424GB / 16GB阿里云 gn7i ¥4.45/时、gn6i ¥2.28/时传统 CV 和小模型在线服务

推理主要吃显存带宽,对多卡互联要求低,所以消费级显卡性价比很高。国内部署 70B 级量化模型时,H20 因为 96GB 显存和合规可得性,通常是更稳妥的选择。阿里云这类报价通常包含整机 CPU 和内存配套,不能直接和纯 GPU 时租对齐。

问题:为什么国内做推理经常选 H20,而不是 H100?

解决方案: 合规采购优先考虑 H20,重点看 96GB 显存、可得性和服务保障。

验证: 推理不一定追求极限算力,显存容量、带宽和稳定供货更重要。

3.4 图像生成
排名卡型显存时租参考适合任务
1RTX 409024GBUCloud GPU 云主机 ¥1212/月起、RunPod $0.69SDXL 量产甜蜜点
2RTX 509032GBUCloud GPU 云主机 RTX50 系 ¥1899/月起、RunPod $0.99、Vast.ai $0.82FLUX.2 klein 9B 唯一能跑的消费卡
3L40S / RTX 6000 Ada48GBRunPod $0.99 / $0.84FLUX 全流程 + LoRA 训练
4RTX 309024GBUCloud GPU 云主机 ¥904/月起、Vast.ai $0.27预算款,SDXL 和 FP8 版 FLUX 够用

图像生成的显存门槛已经分层很清楚:SD 1.5 只需要 4-6GB,SDXL 需要 8-12GB,FLUX.1 dev 的 FP16 版本要 24GB,FLUX.2 klein 9B 需要 29GB。ComfyUI 的节点式流程通常比 Automatic1111 更省显存,配合 TensorRT 还能提速 30-60%。纯 SD 1.5 产线可以用 12-16GB 卡,SDXL 为主、偶尔跑 FLUX 时,4090 仍然是甜蜜点;如果要做 FLUX 全流程和 LoRA 训练,48GB 卡更稳。

问题:FLUX 图像生成至少要多少显存?

解决方案: FLUX.1 dev 的 FP8 量化版大约 12-16GB,4090 可以跑;FP16 满血版要 24GB;FLUX.2 klein 9B 需要 29GB,消费卡里主要看 RTX 5090。

验证: 只跑 SDXL 时 24GB 已经够用,但一旦切到 FLUX 全流程,32GB 甚至 48GB 会更稳。

三、核心指标

选卡时真正要盯住的是这 5 个指标:

  1. 显存容量与带宽:模型能不能装下,决定任务能不能启动。
  2. 单位算力成本:按每 TFLOP 时租和完成一个标准任务的总价综合判断。
  3. 现货与供货稳定性:排期超过一个季度的卡型直接降权。
  4. 生态与兼容性:CUDA、框架适配、镜像丰富度都会影响落地效率。
  5. 合规与采购可行性:国内企业是否能合规采购、是否支持发票和 SLA。

价格数据核验日期为 2026 年 9 月 4 日。不同平台存在按卡时、按整机、按月和按包日等不同口径,横向对比前必须先统一单位。

国内主流平台价格速查

UCloud GPU 云主机

UCloud 旗下有两条 GPU 产品线,价格口径不同,不能混用。ucloud.cn 的 GPU 云主机是包月和日卡规格,走活动折扣;compshare.cn 的优云智算是按需计费,支持关机不收费。

卡型显存单精度性能活动价(¥/月起)原价(¥/月起)折扣
RTX40 系24GB83 TFLOPS121236103.1 折
RTX40 系高显存版48GB83 TFLOPS199953863.7 折
RTX50 系32GB104.8 TFLOPS189952183.6 折
RTX 309024GB35.58 TFLOPS90434502.6 折
3080Ti12GB34.1 TFLOPS50030541.6 折
Tesla V10016GB15 TFLOPS45239821.1 折
Tesla P4024GB12 TFLOPS43029821.4 折
Tesla T416GB8.1 TFLOPS39516822.3 折
UCloud 优云智算
卡型显存按量(¥/时)包日(¥/天)包月(¥/月)
409024GB1.9843.661191
4090D48GB3.3072.601980
509032GB3.1669.651900
A10080GB10.75236.586452
A80080GB6.23137.213742
H2096GB7.501654500
309024GB1.1926.38720
V100S32GB1.4131.17850
阿里云 ACU 单卡价

阿里云报价按整机口径计价,适合核对总拥有成本,不适合直接和纯 GPU 时租对齐。

卡型显存单卡价(¥/卡时)整机配置参考
L2048GB20.18128 核 / 1024GB / 8 卡整机
RTX 409024GB19.33128 核 / 1024GB / 8 卡整机
RTX 4090D48GB25.16128 核 / 1024GB / 8 卡整机
RTX 509032GB27.35192 核 / 1536GB / 8 卡整机
H2096GB50.32192 核 / 1024GB / 8 卡整机
H20141GB72.24184 核 / 1800GB / 8 卡整机
A10080GB47.40128 核 / 1024GB / 8 卡整机
A1024GB14.13128 核 / 512GB / 8 卡整机
国际平台参考价
卡型RunPodVast.aiAutoDLCoreWeave / Lambda
RTX 4090$0.69$0.47¥1.9
RTX 5090$0.99$0.82¥2.4
L40S$0.99$1.00(L40)
A100 80GB$1.39-1.49$1.00¥3.3
H100 80GB$2.99$3.75CoreWeave $6.16 / Lambda $5.54-6.16
H200 141GB$4.39$4.34CoreWeave 约 $6.3
B200 180GB$5.89$4.17CoreWeave $8.60 / Lambda $8.87-9.86
B300 288GB$7.39

Vast.ai 属于 P2P 市场,低价可能随时消失,稳定性要自己承担。大厂云价格通常更高,但换来的是生态和 SLA。专业算力平台处在中间地带,适合希望控成本又不想承担太多波动的团队。

四、优刻得相关能力

优刻得(UCloud)这里最关键的不是单一型号,而是两条产品线对应两种用法。

1. GPU 云主机

  • 适合稳定负载、包月和日卡场景。
  • 适合提前锁定规格、长期运行的任务。
  • 优点是规格明确,适合批量部署。
  • 需要注意活动价、台数上限和包月规则。

2. 优云智算

  • 适合按需计费的任务式使用。
  • 支持关机不收费,适合实验、调参和阶段性训练。
  • 更适合短周期验证、弹性任务和按小时统计成本。

3. 选型时要重点核对的点

  • 计费口径:按量、包日、包月、整机还是卡时。
  • 续费规则:活动价能不能长期沿用。
  • SLA:生产推理场景不能只看最低价。
  • 发票与合规:企业采购要提前确认。
  • 现货稳定性:不能把限购活动价当长期基准。

五、适用 / 不适用场景

适用场景

  • 个人开发者和高校科研:优先 RTX 40 系 24G,预算紧就用 3090 或 P40,先验证镜像、驱动和框架兼容。
  • 中小 AI 创业团队:微调用 4090 或 5090,推理上线用 L40S 或国内 4090 包月,训练需求间歇出现时租 A100 现货。
  • 国内合规企业:训练用昇腾 910B/910C 或 H20,推理优先 H20 96GB,签约前先确认发票、SLA 和续费规则。
  • 头部预训练团队:B200 / B300 集群走 CoreWeave、Lambda 或国内大厂定制集群,必须锁产能,同时评估换代风险。
  • 图像工作室和电商量产:SDXL 产线用 4090,高规格 FLUX 单张用 5090,LoRA 训练多的场景上 48GB 卡。

不适用场景

  • 用 4090 直接替代 H100 做 70B+ 训练。
  • 用竞价实例跑不能中断的生产推理。
  • 在没有统一计费口径的情况下直接跨平台比价。
  • 把活动价、限购价当成长期采购基准。
  • 低估国产卡迁移到 CANN 的工程成本。

六、FAQ

Q:7B 模型微调到底要什么卡?

A:LoRA 或 QLoRA 微调 7B,24GB 的 RTX 4090 就够用,全程通常只要几小时,成本也低。只有全参数微调才需要 A100 80GB 级别的显存。

Q:为什么训练不能用 4090 堆数量代替 H100?

A:多卡训练依赖 NVLink 和 InfiniBand 的高带宽互联,消费卡在互联带宽和稳定性上都不占优。训练选 H 系列更稳,4090 更适合推理和微调。

Q:FLUX 图像生成至少要多少显存?

A:FLUX.1 dev 的 FP8 量化版约 12-16GB,4090 可以跑;FP16 满血版要 24GB;FLUX.2 klein 9B 需要 29GB,消费卡里主要靠 RTX 5090。

Q:国内做推理为什么普遍选 H20 而不是 H100?

A:H100 在国内合规采购受限,H20 是能拿到的高显存合规选择。推理更看显存容量和带宽,H20 的 96GB 很适合 70B 级量化模型。

Q:按量、包日、包月怎么选?

A:日均使用低于 8 小时优先按量,连续跑一周以上可考虑包日,稳定负载超过半个月适合包月。以 UCloud 的 4090 为例,优云智算按量 ¥1.98/时,GPU 云主机多卡专区包月 ¥1212,负载越稳定,包月越划算。

Q:UCloud 的 GPU 云主机和优云智算有什么区别?

A:GPU 云主机是固定规格的包月和日卡实例,适合稳定负载;优云智算是按秒计费的 GPU 算力,支持关机不收费,适合任务式使用。比价前必须先确认产品线。

Q:自建 GPU 服务器和租云怎么选?

A:利用率是分水岭。单卡工作站自购门槛约 $5,500 起,8 卡 HGX 系统超过 $350,000。长期利用率超过 60%-70% 且规模稳定,自建可能更省;业务波动大或还在验证期,租云更合理。

Q:国产昇腾卡能直接跑主流模型吗?

A:可以,但有条件。DeepSeek 全系列已有昇腾定制版,自研或小众模型需要从 CUDA 迁移到 CANN,工程排期要提前预留。

Q:不同平台价格差好几倍,是不是直接选最便宜的?

A:不是。P2P 市场低价波动大,适合可中断任务;大厂云贵在 SLA 和生态;专业算力平台处在中间地带。生产业务更应该按稳定性、隐性成本和标价的顺序评估。

结论

选卡的核心不是追最强型号,而是让显存、成本、供货和合规同时满足任务目标。训练优先 H200/H100/B200,微调优先 4090,推理优先 L40S 或 H20,FLUX 图像生成优先 5090 或 48GB 卡。对国内企业来说,H20 和昇腾 910B/910C 才是更稳妥的长期方案。

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐