三条选型原则,顺序不能反
大多数人选错卡是把顺序搞反了:先被 TFLOPS 吸引,最后才发现显存装不下。
先看显存够不够
硬门槛,不是程度问题。权重加 KV cache 超过显存就直接 OOM 退出,不会「慢一点跑完」。RTX 4090 的算力是 A40 的两倍多,但 48GB 的 A40 能跑 32B 量化推理,24GB 的 4090 不能。
再比单位算力成本
同一档位通常有三四款卡都能跑,这时比的是每 GB 显存与每 TFLOPS 各多少钱。48GB 档里 A40 ₮6.65 / GB、L40S ₮13.52 / GB 差一倍,但 L40S 算力是 A40 的近十倍——任务偏显存还是偏算力,决定往哪边靠。
最后才看绝对性能
预算与显存都不构成约束时,「谁最快」才成为主要问题,而这只出现在赶工期的训练和吞吐直接换钱的在线推理上。跑实验、写毕设、出图,把 3 小时缩到 2 小时多付的租金不值。
显存档位对照表:每一档能跑什么
价格为单卡月租(30 天)与周租(7 天),含 vCPU、内存、NVMe 系统盘、25 Gbps 不限流量出口与 1 个美国公网 IPv4。「每 GB 月成本」= 月租 ÷ 显存。
| 显存档 | 代表卡型(月租 / 周租) | 每 GB 月成本 | 这一档典型能跑的任务 |
|---|---|---|---|
| 24 GB入门与出图主力 | RTX 4090 ₮369 / ₮109 RTX 3090 ₮249 / ₮75 NVIDIA L4 ₮239 / ₮72 RTX A5000 ₮219 / ₮65 |
₮9.13 – ₮15.38 | SD 1.5 与 SDXL 出图、ComfyUI 工作流;7B 模型 FP16 短上下文或 INT4 长上下文推理;7B QLoRA 微调;Whisper 转写、YOLO 训练。 |
| 32 GB出图进阶 | RTX 5090新品 ₮499 / ₮149 | ₮15.59 | Flux.1 dev 全精度出图、SDXL 高分辨率与批量出图;14B 模型 INT8 推理;7B LoRA 微调全速跑。Blackwell 架构原生支持 FP4 / FP8,量化推理吞吐好于 40 系。 |
| 48 GB性价比甜点 | NVIDIA L40S ₮649 / ₮189 RTX 6000 Ada ₮579 / ₮169 RTX A6000 ₮389 / ₮115 NVIDIA A40 ₮319 / ₮95 |
₮6.65 – ₮13.52 | 32B 模型 INT4 / INT8 推理;13B–14B 模型 FP16 推理;32B LoRA 微调;HunyuanVideo、Wan 视频生成;Blender 大场景渲染;7×24 在线推理后端。 |
| 80 GB训练与大模型分界线 | H100 SXM热销 ₮1,899 / ₮549 H100 PCIe ₮1,549 / ₮449 A100 SXM ₮1,099 / ₮319 A100 PCIe ₮899 / ₮269 |
₮11.24 – ₮23.74 | 70B 模型 INT4 单卡推理;32B 模型 FP16 推理;13B 全参微调、70B QLoRA;32K 以上长上下文服务;多卡组节点做预训练与全参微调。 |
| 141 GB单卡大模型 | NVIDIA H200 ₮2,599 / ₮739 | ₮18.43 | 70B 模型 INT8 单卡推理并留出充裕 KV cache;MoE 模型单卡加载;128K 长上下文不切分。但 70B 的 FP16 权重就要 140 GB,这一档装不下,见下文。 |
| 180 GB新架构旗舰 | NVIDIA B200新品 ₮3,899 / ₮1,099 | ₮21.66 | 百亿到千亿参数模型的单卡加载与 FP4 / FP8 推理;对吞吐要求最高的在线服务。只在芝加哥 ORD-1 供货,库存紧张,建议提前预订。 |
| 192 GB单卡显存之最 | AMD MI300X ₮1,699 / ₮489 | ₮8.85 | 70B 模型 FP16 单卡推理(权重加 KV cache 一张卡装得下);显存密集、依赖简单的批量推理。每 GB ₮8.85 是 80GB 以上最便宜的,代价是 ROCm 生态。 |
按任务直接选:常见场景速查
找最接近你的那一行。每行给「够用」和「更快」两个选择,先按「够用」租一周试。
| 任务 | 显存需求 | 够用就好 | 更快 / 更稳 | 月租区间 |
|---|---|---|---|---|
| SD / SDXL 出图 ComfyUI、Automatic1111 | 12–20 GB | RTX 3090 24GB | RTX 4090 24GB | ₮249 – ₮369 |
| Flux / 高分辨率出图 全精度模型、批量出图 | 24–40 GB | RTX 5090 32GB | L40S 48GB | ₮499 – ₮649 |
| 7B 模型推理 Qwen、Llama、GLM 同级 | 6 GB(INT4)– 18 GB(FP16) | RTX A5000 24GB | RTX 4090 24GB | ₮219 – ₮369 |
| 14B 模型推理 | 10 GB(INT4)– 32 GB(FP16) | RTX A6000 48GB | RTX 5090 32GB / L40S | ₮389 – ₮649 |
| 32B 模型推理 | 20 GB(INT4)– 68 GB(FP16) | RTX A6000 48GB(INT4) | A100 PCIe 80GB(FP16) | ₮389 – ₮899 |
| 70B 模型推理 | 40 GB(INT4)– 160 GB(FP16) | A100 PCIe 80GB(INT4) | H200 141GB(INT8)/ MI300X 192GB(FP16) | ₮899 – ₮2,599 |
| LoRA / QLoRA 微调 7B–32B | 10–48 GB | RTX 4090 24GB(7B QLoRA) | A100 SXM 80GB(32B LoRA) | ₮369 – ₮1,099 |
| 全参微调 参数量 × 16 字节 | 112 GB 起(7B) | 2 × A100 SXM(₮2,176) | 8 × H100 SXM(₮14,432) | ₮2,176 – ₮14,432 |
| 视频生成 Wan、HunyuanVideo、CogVideoX | 24–48 GB | RTX A6000 48GB | L40S 48GB / H100 80GB | ₮389 – ₮1,899 |
| 3D 渲染 Blender Cycles、OctaneRender | 16–48 GB(看场景大小) | NVIDIA A40 48GB | RTX 4090 24GB(小场景更快) | ₮319 – ₮369 |
| 科研入门 / 跑通代码 复现论文、写毕设、学 CUDA | 8–24 GB | RTX A5000 24GB | NVIDIA L4 24GB(能效更好) | ₮219 – ₮239 |
多卡按倍率计价:2 卡 ×1.98、4 卡 ×3.92、8 卡 ×7.6(8 卡等于 95 折)。表中 2 × A100 SXM = 1,099 × 1.98 = ₮2,176,8 × H100 SXM = 1,899 × 7.6 = ₮14,432。完整多卡报价见 GPU 租用价格页。
显存自己怎么算:三个公式
与其猜不如花两分钟算。三个公式覆盖推理、LoRA 与全参微调,误差两成以内,足够定卡型。
# 公式一:推理显存 ≈ 权重 + KV cache + 框架开销(约 1.2 倍) 权重(GB) = 参数量(B) × 每参数字节数 FP16 = 2 字节 INT8 = 1 字节 INT4 = 0.5 字节 # 举例:Qwen 类 32B 模型,四种精度下的权重占用 32B × 2 = 64 GB # FP16,单卡要 80GB 起 32B × 1 = 32 GB # INT8,48GB 卡刚好,余 16GB 给 KV cache 32B × 0.5 = 16 GB # INT4,24GB 卡装得下,上下文开不大 # 公式二:KV cache ≈ 2 × 层数 × 隐藏维度 × 上下文长度 × 并发 × 精度字节数 # 70B 模型(80 层,8192 维),8K 上下文,单并发,FP16: 2 × 80 × 8192 × 8192 × 1 × 2 ≈ 21 GB # 所以 70B INT4(35GB 权重)要配 80GB 卡,48GB 不够 # 公式三:全参微调 ≈ 参数量 × 16 字节(AdamW 混合精度) # FP16 权重 2 + 梯度 2 + Adam 动量 8 + FP32 主权重 4 = 16 7B × 16 = 112 GB # 单张 80GB 装不下,要 2 卡或 offload 70B × 16 = 1,120 GB # 8 × H100 SXM(640GB)也要配流水并行 # LoRA 只训练适配器:显存 ≈ 权重 + 少量优化器状态 7B FP16 LoRA ≈ 18–20 GB # 24GB 卡够 7B 4bit QLoRA ≈ 8–10 GB # 24GB 卡宽裕,还能开长上下文
单位成本排序:显存最便宜的和算力最便宜的
同一笔预算,买显存和买算力是两回事。下表把 16 款卡按显存单价排序。
| 卡型 | 显存 | 月租 | 每 GB 显存月成本 | 标称 FP16 | 每 TFLOPS 月成本 |
|---|---|---|---|---|---|
| NVIDIA A40 | 48 GB | ₮319 | ₮6.65 | 37 | ₮8.62 |
| RTX A6000 | 48 GB | ₮389 | ₮8.10 | 77 | ₮5.05 |
| AMD MI300X | 192 GB | ₮1,699 | ₮8.85 | 1,307 | ₮1.30 |
| RTX A5000 | 24 GB | ₮219 | ₮9.13 | 54 | ₮4.06 |
| NVIDIA L4 | 24 GB | ₮239 | ₮9.96 | 121 | ₮1.98 |
| RTX 3090 | 24 GB | ₮249 | ₮10.38 | 71 | ₮3.51 |
| A100 PCIe | 80 GB | ₮899 | ₮11.24 | 312 | ₮2.88 |
| RTX 6000 Ada | 48 GB | ₮579 | ₮12.06 | 91 | ₮6.36 |
| NVIDIA L40S | 48 GB | ₮649 | ₮13.52 | 362 | ₮1.79 |
| A100 SXM | 80 GB | ₮1,099 | ₮13.74 | 312 | ₮3.52 |
| RTX 4090 | 24 GB | ₮369 | ₮15.38 | 82 | ₮4.50 |
| RTX 5090 | 32 GB | ₮499 | ₮15.59 | 105 | ₮4.75 |
| NVIDIA H200 | 141 GB | ₮2,599 | ₮18.43 | 989 | ₮2.63 |
| H100 PCIe | 80 GB | ₮1,549 | ₮19.36 | 756 | ₮2.05 |
| NVIDIA B200 | 180 GB | ₮3,899 | ₮21.66 | 2,250 | ₮1.73 |
| H100 SXM | 80 GB | ₮1,899 | ₮23.74 | 989 | ₮1.92 |
- 买显存最划算:A40(₮6.65 / GB)、RTX A6000(₮8.10)、MI300X(₮8.85)。算力都不突出,适合模型大但计算不密集的场景:低并发推理、大场景渲染。
- 买算力最划算:MI300X(₮1.30 / TFLOPS)、B200(₮1.73)、L40S(₮1.79)。跑满负载的训练与高并发推理往这端选——卡越贵单位算力反而越便宜。
- FP16 数字的口径:TFLOPS 取自标称值,厂商稠密 / 稀疏口径不统一(4090、5090 尤其如此),只适合同代同类卡粗比,跨代横比会失真。
四件必须先知道的事
不是卖点,是工单里出现最多的「早知道就选另一张了」。
MI300X 显存最大,但生态不是 CUDA
192 GB 显存、₮1,699 月租、₮8.85 每 GB,纸面上在 80GB 以上档位毫无对手,代价是它跑 ROCm 不是 CUDA。依赖自定义 CUDA kernel、冷门量化库或社区插件的项目,先花 ₮489 租一周跑通一轮再开月租,别把整月预算押在没验证过的环境上。详见 MI300X 租用。
消费卡多卡拼不出大显存
「两张 4090 等于一张 48GB 卡吗」——不等于。RTX 4090、5090、3090 没有 NVLink,只能走 PCIe 交换,张量并行时卡间通信就是瓶颈。消费卡的多卡场景是同时跑多个独立任务,不是拼一块大显存;要凑显存只能选 SXM / OAM 卡,名单见下方问答。
我们只有周租和月租,没有按小时
最短计费周期 7 天,下单时从余额一次性扣除,周期内价格锁死。「一天开两小时调代码」这种用法在这里等于为闲置付钱。平衡点算得出来:月租 ÷ 按小时单价 ÷ 24,RTX 4090 代入 ₮1.2 / 小时约 12.8 天,H100 SXM 代入 ₮4.0 / 小时约 20 天,开机时间不到这条线就该去按秒平台,见 包月还是按小时 与 平台对比。
选卡之外,还要选机房
同一款卡不是四个机房都有:MI300X 只在达拉斯 DFW-1,B200 只在芝加哥 ORD-1,L40S 与 RTX 4090 四个都有。从中国大陆访问的往返延迟 140–190 ms,LAS-1 最低(约 142 ms):训练、微调、批量推理不受影响,SSH 逐字符输入与 Jupyter 拖拽会有迟滞,见 延迟与线路。
选型常见问题
显存不够,能靠多租几张卡凑吗?
24GB 的 RTX 4090 能跑 70B 模型吗?
MI300X 192GB 才 ₮1,699,为什么大家还租 H100?
同样是 80GB,A100 和 H100 差在哪?值得多花 ₮800 吗?
消费卡和专业卡,除了显存还有什么区别?
拿不准选哪张,一周能试出结果吗?
本页最后更新: · 价格与库存以 GPU 租用价格 页为准