首页/GPU 租用/GPU 选型指南

GPU SELECTION GUIDE

GPU 怎么选:按显存和任务倒推卡型

租什么显卡划算,不该从「哪张最强」想起,而该从「我的任务要多少显存」倒推。这一页把 24GB 到 192GB 七个显存档位、16 款在租卡型的月租价与能跑的任务列成一张表,再按出图、推理、微调、渲染逐项给建议。

一句话回答:选 GPU 的顺序是先算显存够不够,再比单位成本,最后才看绝对性能——显存不够就是跑不了,卡再快也没用。出图与 7B 推理用 24GB 的 RTX 4090(₮369 / 月),32B 推理用 48GB 的 RTX A6000(₮389 / 月),70B 推理要 80GB 的 A100 或 H100(₮899 起),全参微调连 7B 都得两张 80GB 卡起步;单卡显存最大的是 192GB 的 AMD MI300X(₮1,699 / 月)。
Three Rules

三条选型原则,顺序不能反

大多数人选错卡是把顺序搞反了:先被 TFLOPS 吸引,最后才发现显存装不下。

01

先看显存够不够

硬门槛,不是程度问题。权重加 KV cache 超过显存就直接 OOM 退出,不会「慢一点跑完」。RTX 4090 的算力是 A40 的两倍多,但 48GB 的 A40 能跑 32B 量化推理,24GB 的 4090 不能。

02

再比单位算力成本

同一档位通常有三四款卡都能跑,这时比的是每 GB 显存与每 TFLOPS 各多少钱。48GB 档里 A40 ₮6.65 / GB、L40S ₮13.52 / GB 差一倍,但 L40S 算力是 A40 的近十倍——任务偏显存还是偏算力,决定往哪边靠。

03

最后才看绝对性能

预算与显存都不构成约束时,「谁最快」才成为主要问题,而这只出现在赶工期的训练和吞吐直接换钱的在线推理上。跑实验、写毕设、出图,把 3 小时缩到 2 小时多付的租金不值。

VRAM Tiers

显存档位对照表:每一档能跑什么

价格为单卡月租(30 天)与周租(7 天),含 vCPU、内存、NVMe 系统盘、25 Gbps 不限流量出口与 1 个美国公网 IPv4。「每 GB 月成本」= 月租 ÷ 显存。

全部 16 款报价 →
显存档代表卡型(月租 / 周租)每 GB 月成本这一档典型能跑的任务
24 GB入门与出图主力 RTX 4090 ₮369 / ₮109
RTX 3090 ₮249 / ₮75
NVIDIA L4 ₮239 / ₮72
RTX A5000 ₮219 / ₮65
₮9.13 – ₮15.38 SD 1.5 与 SDXL 出图、ComfyUI 工作流;7B 模型 FP16 短上下文或 INT4 长上下文推理;7B QLoRA 微调;Whisper 转写、YOLO 训练。
32 GB出图进阶 RTX 5090新品 ₮499 / ₮149 ₮15.59 Flux.1 dev 全精度出图、SDXL 高分辨率与批量出图;14B 模型 INT8 推理;7B LoRA 微调全速跑。Blackwell 架构原生支持 FP4 / FP8,量化推理吞吐好于 40 系。
48 GB性价比甜点 NVIDIA L40S ₮649 / ₮189
RTX 6000 Ada ₮579 / ₮169
RTX A6000 ₮389 / ₮115
NVIDIA A40 ₮319 / ₮95
₮6.65 – ₮13.52 32B 模型 INT4 / INT8 推理;13B–14B 模型 FP16 推理;32B LoRA 微调;HunyuanVideo、Wan 视频生成;Blender 大场景渲染;7×24 在线推理后端。
80 GB训练与大模型分界线 H100 SXM热销 ₮1,899 / ₮549
H100 PCIe ₮1,549 / ₮449
A100 SXM ₮1,099 / ₮319
A100 PCIe ₮899 / ₮269
₮11.24 – ₮23.74 70B 模型 INT4 单卡推理;32B 模型 FP16 推理;13B 全参微调、70B QLoRA;32K 以上长上下文服务;多卡组节点做预训练与全参微调。
141 GB单卡大模型 NVIDIA H200 ₮2,599 / ₮739 ₮18.43 70B 模型 INT8 单卡推理并留出充裕 KV cache;MoE 模型单卡加载;128K 长上下文不切分。但 70B 的 FP16 权重就要 140 GB,这一档装不下,见下文。
180 GB新架构旗舰 NVIDIA B200新品 ₮3,899 / ₮1,099 ₮21.66 百亿到千亿参数模型的单卡加载与 FP4 / FP8 推理;对吞吐要求最高的在线服务。只在芝加哥 ORD-1 供货,库存紧张,建议提前预订。
192 GB单卡显存之最 AMD MI300X ₮1,699 / ₮489 ₮8.85 70B 模型 FP16 单卡推理(权重加 KV cache 一张卡装得下);显存密集、依赖简单的批量推理。每 GB ₮8.85 是 80GB 以上最便宜的,代价是 ROCm 生态。
关于「能跑」的口径:指权重加合理长度的 KV cache 能装进单卡显存并稳定运行,不代表跑得快——同一个 32B 模型,A40 的 INT4 与 L40S 的 INT8 吞吐能差三到五倍,但都算「能跑」。精确值用下一节的公式算。
By Task

按任务直接选:常见场景速查

找最接近你的那一行。每行给「够用」和「更快」两个选择,先按「够用」租一周试。

成本计算指南 →
任务显存需求够用就好更快 / 更稳月租区间
SD / SDXL 出图
ComfyUI、Automatic1111
12–20 GBRTX 3090 24GBRTX 4090 24GB₮249 – ₮369
Flux / 高分辨率出图
全精度模型、批量出图
24–40 GBRTX 5090 32GBL40S 48GB₮499 – ₮649
7B 模型推理
Qwen、Llama、GLM 同级
6 GB(INT4)– 18 GB(FP16)RTX A5000 24GBRTX 4090 24GB₮219 – ₮369
14B 模型推理10 GB(INT4)– 32 GB(FP16)RTX A6000 48GBRTX 5090 32GB / L40S₮389 – ₮649
32B 模型推理20 GB(INT4)– 68 GB(FP16)RTX A6000 48GB(INT4)A100 PCIe 80GB(FP16)₮389 – ₮899
70B 模型推理40 GB(INT4)– 160 GB(FP16)A100 PCIe 80GB(INT4)H200 141GB(INT8)/ MI300X 192GB(FP16)₮899 – ₮2,599
LoRA / QLoRA 微调
7B–32B
10–48 GBRTX 4090 24GB(7B QLoRA)A100 SXM 80GB(32B LoRA)₮369 – ₮1,099
全参微调
参数量 × 16 字节
112 GB 起(7B)2 × A100 SXM(₮2,176)8 × H100 SXM(₮14,432)₮2,176 – ₮14,432
视频生成
Wan、HunyuanVideo、CogVideoX
24–48 GBRTX A6000 48GBL40S 48GB / H100 80GB₮389 – ₮1,899
3D 渲染
Blender Cycles、OctaneRender
16–48 GB(看场景大小)NVIDIA A40 48GBRTX 4090 24GB(小场景更快)₮319 – ₮369
科研入门 / 跑通代码
复现论文、写毕设、学 CUDA
8–24 GBRTX A5000 24GBNVIDIA L4 24GB(能效更好)₮219 – ₮239

多卡按倍率计价:2 卡 ×1.98、4 卡 ×3.92、8 卡 ×7.6(8 卡等于 95 折)。表中 2 × A100 SXM = 1,099 × 1.98 = ₮2,176,8 × H100 SXM = 1,899 × 7.6 = ₮14,432。完整多卡报价见 GPU 租用价格页

Do The Math

显存自己怎么算:三个公式

与其猜不如花两分钟算。三个公式覆盖推理、LoRA 与全参微调,误差两成以内,足够定卡型。

使用文档 →
# 公式一:推理显存 ≈ 权重 + KV cache + 框架开销(约 1.2 倍)
权重(GB) = 参数量(B) × 每参数字节数
  FP16 = 2 字节   INT8 = 1 字节   INT4 = 0.5 字节

# 举例:Qwen 类 32B 模型,四种精度下的权重占用
32B × 2   = 64 GB  # FP16,单卡要 80GB 起
32B × 1   = 32 GB  # INT8,48GB 卡刚好,余 16GB 给 KV cache
32B × 0.5 = 16 GB  # INT4,24GB 卡装得下,上下文开不大

# 公式二:KV cache ≈ 2 × 层数 × 隐藏维度 × 上下文长度 × 并发 × 精度字节数
# 70B 模型(80 层,8192 维),8K 上下文,单并发,FP16:
2 × 80 × 8192 × 8192 × 1 × 2 ≈ 21 GB
# 所以 70B INT4(35GB 权重)要配 80GB 卡,48GB 不够

# 公式三:全参微调 ≈ 参数量 × 16 字节(AdamW 混合精度)
#   FP16 权重 2 + 梯度 2 + Adam 动量 8 + FP32 主权重 4 = 16
7B  × 16 = 112 GB  # 单张 80GB 装不下,要 2 卡或 offload
70B × 16 = 1,120 GB # 8 × H100 SXM(640GB)也要配流水并行

# LoRA 只训练适配器:显存 ≈ 权重 + 少量优化器状态
7B FP16 LoRA  ≈ 18–20 GB  # 24GB 卡够
7B 4bit QLoRA ≈ 8–10 GB   # 24GB 卡宽裕,还能开长上下文
一个反复被问到的坑:很多人以为 141GB 的 H200 一定能单卡跑 70B FP16。算一下:70 × 2 = 140 GB 权重,加上开销与 KV cache 实际要 160 GB 以上,装不下。单卡跑 70B FP16 得上 192GB 的 MI300X;H200 上应该用 INT8,权重 70 GB,剩下 70 GB 全给 KV cache,反而能开更长的上下文。
Cost Per Unit

单位成本排序:显存最便宜的和算力最便宜的

同一笔预算,买显存和买算力是两回事。下表把 16 款卡按显存单价排序。

完整报价表 →
卡型显存月租每 GB 显存月成本标称 FP16每 TFLOPS 月成本
NVIDIA A4048 GB₮319₮6.6537₮8.62
RTX A600048 GB₮389₮8.1077₮5.05
AMD MI300X192 GB₮1,699₮8.851,307₮1.30
RTX A500024 GB₮219₮9.1354₮4.06
NVIDIA L424 GB₮239₮9.96121₮1.98
RTX 309024 GB₮249₮10.3871₮3.51
A100 PCIe80 GB₮899₮11.24312₮2.88
RTX 6000 Ada48 GB₮579₮12.0691₮6.36
NVIDIA L40S48 GB₮649₮13.52362₮1.79
A100 SXM80 GB₮1,099₮13.74312₮3.52
RTX 409024 GB₮369₮15.3882₮4.50
RTX 509032 GB₮499₮15.59105₮4.75
NVIDIA H200141 GB₮2,599₮18.43989₮2.63
H100 PCIe80 GB₮1,549₮19.36756₮2.05
NVIDIA B200180 GB₮3,899₮21.662,250₮1.73
H100 SXM80 GB₮1,899₮23.74989₮1.92
  • 买显存最划算:A40(₮6.65 / GB)、RTX A6000(₮8.10)、MI300X(₮8.85)。算力都不突出,适合模型大但计算不密集的场景:低并发推理、大场景渲染。
  • 买算力最划算:MI300X(₮1.30 / TFLOPS)、B200(₮1.73)、L40S(₮1.79)。跑满负载的训练与高并发推理往这端选——卡越贵单位算力反而越便宜。
  • FP16 数字的口径:TFLOPS 取自标称值,厂商稠密 / 稀疏口径不统一(4090、5090 尤其如此),只适合同代同类卡粗比,跨代横比会失真。
Caveats

四件必须先知道的事

不是卖点,是工单里出现最多的「早知道就选另一张了」。

MI300X 显存最大,但生态不是 CUDA

192 GB 显存、₮1,699 月租、₮8.85 每 GB,纸面上在 80GB 以上档位毫无对手,代价是它跑 ROCm 不是 CUDA。依赖自定义 CUDA kernel、冷门量化库或社区插件的项目,先花 ₮489 租一周跑通一轮再开月租,别把整月预算押在没验证过的环境上。详见 MI300X 租用

消费卡多卡拼不出大显存

「两张 4090 等于一张 48GB 卡吗」——不等于。RTX 4090、5090、3090 没有 NVLink,只能走 PCIe 交换,张量并行时卡间通信就是瓶颈。消费卡的多卡场景是同时跑多个独立任务,不是拼一块大显存;要凑显存只能选 SXM / OAM 卡,名单见下方问答。

我们只有周租和月租,没有按小时

最短计费周期 7 天,下单时从余额一次性扣除,周期内价格锁死。「一天开两小时调代码」这种用法在这里等于为闲置付钱。平衡点算得出来:月租 ÷ 按小时单价 ÷ 24,RTX 4090 代入 ₮1.2 / 小时约 12.8 天,H100 SXM 代入 ₮4.0 / 小时约 20 天,开机时间不到这条线就该去按秒平台,见 包月还是按小时平台对比

选卡之外,还要选机房

同一款卡不是四个机房都有:MI300X 只在达拉斯 DFW-1,B200 只在芝加哥 ORD-1,L40S 与 RTX 4090 四个都有。从中国大陆访问的往返延迟 140–190 ms,LAS-1 最低(约 142 ms):训练、微调、批量推理不受影响,SSH 逐字符输入与 Jupyter 拖拽会有迟滞,见 延迟与线路

FAQ

选型常见问题

帮助中心 →
显存不够,能靠多租几张卡凑吗?
要看卡型。SXM / OAM 封装的卡(H100 SXM、H200、B200、A100 SXM、MI300X)节点内 NVLink 全互联,显存可合并,8 卡 H100 SXM 合计 640 GB。专业 PCIe 卡支持双卡 NVLink 桥接。而 RTX 4090、5090、3090 没有 NVLink,只能走 PCIe 交换,带宽差一个数量级,硬拆模型会慢到失去意义。想靠多卡凑显存就选 SXM 卡。
24GB 的 RTX 4090 能跑 70B 模型吗?
不能。70B 即使量化到 INT4,权重也要 35 GB,加上 KV cache 与开销要 40–45 GB。硬跑只能把部分层 offload 到内存或硬盘,速度掉到每秒几个 token。单卡跑 70B 的门槛是 80 GB:A100 PCIe ₮899 / 月做 INT4 推理最便宜;要 FP16 得上 192 GB 的 MI300X(₮1,699 / 月)。4090 的定位是出图与 7B–13B 推理。
MI300X 192GB 才 ₮1,699,为什么大家还租 H100?
因为生态。MI300X 的显存与纸面算力性价比确实是全站最好的(₮8.85 / GB、₮1.30 / TFLOPS),跑 PyTorch 加 vLLM 没有大问题。但它用 ROCm 不是 CUDA:依赖自定义 CUDA kernel、部分量化库与图像视频生成插件的项目,要么改代码,要么没有 ROCm 版本。H100 SXM 每月比它贵 ₮200,这 ₮200 买的是「装上就能跑」,值不值取决于你的依赖有多冷门。
同样是 80GB,A100 和 H100 差在哪?值得多花 ₮800 吗?
显存一样,差在算力与互联。H100 SXM 标称 FP16 989 TFLOPS,A100 SXM 是 312,且 H100 支持 FP8。H100 SXM 每 TFLOPS 月成本 ₮1.92,反而比 A100 SXM 的 ₮3.52 便宜——卡长期跑满时 H100 更划算。但若任务显存密集而计算不密集(低并发推理、数据预处理),卡大半时间在等数据,A100 PCIe ₮899 / 月能省一半以上。
消费卡和专业卡,除了显存还有什么区别?
三点:显存档位,专业卡有 48 GB,消费卡最高 32 GB;ECC 纠错,长时间训练遇到显存位翻转专业卡能纠正,消费卡只能崩掉重跑;多卡互联,专业 PCIe 卡支持双卡 NVLink 桥接。反过来,消费卡单卡出图与推理的每元性能更好,RTX 4090 ₮369 跑 SDXL 比 ₮579 的 RTX 6000 Ada 又快又便宜。
拿不准选哪张,一周能试出结果吗?
能,判据有两个。先按上表「够用就好」那列开周租(7 天一个周期,RTX A5000 ₮65、RTX 4090 ₮109、A100 SXM ₮319、H100 SXM ₮549),盯 nvidia-smi:显存峰值长期贴到 90% 以上就往上换一档;GPU 利用率长期低于 40%,瓶颈在数据加载而非卡,换更快的型号是白花钱。1 小时内可无理由退款到余额,当场换。转不转月租见 包月还是按小时;充值余额只能消费不能提现,按需充。
Get Started

算清楚了,就先租一周

邮箱注册,USDT 充值,三分钟拿到 SSH;选错卡 1 小时内可退款到余额。

价格与库存以 GPU 租用价格 页为准。只收 USDT、BTC、XMR 等加密货币,不收法币也开不出发票,见 加密货币付款无需实名说明

本页最后更新: · 价格与库存以 GPU 租用价格 页为准

Telegram
Telegram 客服@gpuli_cn7×24 小时在线
工单