首页/GPU 租用/微调 Qwen 选卡

QWEN FINETUNE GPU

微调 Qwen 该租什么显卡

微调 Qwen 这类开源大模型,选卡的分歧点不在算力而在显存:LoRA 与全参的需求能差出十倍。这一页算清三条路线的显存账,给出按模型规模对应的卡型与月租,并附一份 8 卡 H100 的完整月账单。

一句话回答:LoRA / QLoRA 微调 7B 级 Qwen,一张 24 GB 的 RTX 4090 就够,月租 ₮369;全参按每参数 12–16 字节估显存,7B 级至少要 80 GB 单卡(A100 / H100),14B 级要 4 卡,32B 以上老实上 8 卡 H100,月租 ₮14,432;继续预训练是多机的事,还要另配 InfiniBand。
Three Routes

三条路线,显存差十倍

绝大多数「微调 Qwen」的需求是第一种,很多人却按第三种去租卡。

全部 16 款报价 →
01

LoRA / QLoRA

底座冻结,只训练插入的低秩矩阵,可训练参数占 0.1%–1%,显存只剩「装下底座」这一项。QLoRA 把底座量化到 4-bit,7B 权重压到 4 GB 左右,24 GB 消费卡够用。

02

全参微调

每参数要同时留住 bf16 权重、bf16 梯度、fp32 主权重与 AdamW 两个动量,合计 16 字节。7B 就要 70–112 GB,卡在 80 GB 单卡的下限,14B 以上必须多卡分片。

03

继续预训练

显存账和全参一样,但时间尺度是周和月,瓶颈变成数据吞吐与卡间通信。单节点 8 卡起步,跨节点还要加 400G InfiniBand,₮600 / 节点 / 月,仅 DFW-1 与 ORD-1 提供。

先做一次成本判断:LoRA 与全参的效果差距,通常远小于两者 30–40 倍的成本差距。先用一张周租 RTX 4090(₮109 / 7 天)跑通数据管线和评测集,确认 LoRA 压不住业务指标再上 8 卡。
LoRA Sizing

LoRA / QLoRA:按模型规模选卡

按序列 2048、micro-batch 1、开梯度检查点与 FlashAttention-2 估的峰值显存,已含碎片余量;拉长上下文再留 20%–40%。

模型规模QLoRA(4-bit 底座)LoRA(bf16 底座)够用的卡型月租周租
7B / 8B 级8–12 GB20–26 GBQLoRA:RTX 4090 24GB
bf16:RTX 5090 32GB
₮369 / ₮499₮109 / ₮149
14B 级14–18 GB34–42 GBQLoRA:RTX 4090 / 5090
bf16:L40S 48GB
₮369 / ₮649₮109 / ₮189
32B 级24–32 GB72–86 GBQLoRA:RTX A6000 48GB
bf16:A100 80GB
₮389 / ₮899₮115 / ₮269
72B 级46–58 GB155–175 GBQLoRA:A100 PCIe 80GB
bf16:MI300X 192GB 单卡
₮899 / ₮1,699₮269 / ₮489

72B 的 bf16 LoRA 是少数值得考虑 AMD MI300X 的场景:192 GB 单卡装得下整个底座,省掉分片通信;代价是 ROCm 下部分算子要自己验证,依赖自定义 CUDA kernel 的还是选 A100 80GBH100

QLoRA 的代价不是零:4-bit 让显存降到四分之一,但反量化发生在每次前向里,吞吐比 bf16 LoRA 低 20%–40%。显存本来就够时别为「好看」去开 4-bit。
Full Finetune

全参微调:显存到底怎么算

混合精度 AdamW 下每参数的常驻开销是固定的四笔账,加起来就是「参数量 × 系数」。

成本计算指南 →
常驻项bf16 + AdamW+ 8-bit 优化器
bf16 权重2 字节2 字节
bf16 梯度2 字节2 字节
fp32 主权重4 字节4 字节
动量 m + 方差 v8 字节2 字节
合计(每参数)16 字节10 字节

激活值另算,再留 15%–30%。「12–16 倍参数量」这个经验系数说的就是上表加激活余量后的占用。

模型规模状态显存最小可行配置月租
7B / 8B 级70–112 GB1 × A100 / H100 80GB(须 8-bit 优化器)
宽裕:1 × H200 141GB
₮899 起 / ₮2,599
14B 级140–224 GB4 × A100 SXM(ZeRO-3)
宽裕:4 × H100 SXM
₮4,308 / ₮7,444
32B 级320–512 GB8 × A100 SXM 640GB(ZeRO-3)
宽裕:8 × H100 SXM
₮8,352 / ₮14,432
72B 级720–1,152 GB8 × H100 SXM + 优化器 offload
宽裕:8 × H200 + 8-bit 优化器
₮14,432 / ₮19,752
72B 全参这一格值得展开:16 字节 × 72B ≈ 1,152 GB,8 卡 H100 的 640 GB 装不下,开 ZeRO-3 也不行。做法是把 fp32 主权重与两个动量(12 字节 / 参数 ≈ 864 GB)offload 到主机内存——8 卡 H100 实例分到 1,600 GB,放得下——显存里只留分片后的权重与梯度,约 36 GB / 卡,吞吐掉 20%–50%。不想 offload 就上 8 卡 H200(1,128 GB)配 8-bit 优化器,约 90 GB / 卡。
Memory Switches

四个省显存的开关,省的不是同一样东西

它们常被一起打开,搞混了就会得出「开了 bf16 怎么还 OOM」这种结论。

  • 混合精度(bf16)不省优化器。上一节那 12 字节的 fp32 主权重与动量原封不动,减半的只有激活值与算子中间量,整体约省 25%–35%。它真正的收益是算得快、动态范围够大不必 loss scaling。
  • 梯度检查点省的是激活值。反向时重算而不保存中间激活,激活显存从随层数线性增长降到约平方根级别,实测省 60%–80%,代价是吞吐降 20%–30%。长上下文必开:2K 拉到 32K,激活是主要增量。
  • 8-bit 优化器省的是动量。AdamW 的 m 与 v 从 fp32 压到 int8,每参数由 16 字节降到 10 字节,7B 全参从 112 GB 降到 70 GB,正好卡进 80 GB 单卡。长周期预训练还是 fp32 动量保险。
  • 梯度累积不省显存,只换等效 batch。micro-batch 设 1、累积 16 步,等效 batch 就是 16,峰值显存仍按 micro-batch 1 算。真正吃穷显存的是 micro-batch 和序列长度。
Sharding

多卡怎么配:ZeRO 分级与互联方式

DeepSpeed 的 ZeRO(以及 PyTorch 原生 FSDP)按「分片什么」分三级,N 为卡数。

使用文档 →
阶段分片对象每卡字节 / 参数8 卡时 32B 每卡占用通信量适用
ZeRO-1优化器状态4 + 12 / N176 GB与 DDP 相同只差一点显存时最省事
ZeRO-2+ 梯度2 + 14 / N120 GB与 DDP 相同单机 8 卡的默认档
ZeRO-3+ 参数本身16 / N64 GB约 DDP 的 1.5 倍模型放不下一张卡时
ZeRO-Offload状态移到主机内存4 / N 起16 GB额外走 PCIe 与 CPU卡不够、时间够

这张表点出一件常被忽略的事:8 卡跑 32B 全参,ZeRO-1 与 ZeRO-2 每卡还要 176 GB 和 120 GB,都塞不进 80 GB 的 H100,必须上 ZeRO-3 才落到 64 GB。而 ZeRO-3 每步都要 all-gather 参数分片,卡间互联就成了决定因素。

SXM / OAM 卡:NVLink 全互联

H100 SXMH200B200、A100 SXM 与 MI300X 在同一物理节点内 NVLink 全互联,ZeRO-3 的 all-gather 不会成为瓶颈。

PCIe 卡:ZeRO-3 会掉速

L40S、RTX 4090 / 5090 / 3090 走 PCIe 交换,没有 NVLink;A6000、A40、RTX 6000 Ada 双卡可 NVLink 桥接,ZeRO-2 以内够用。

Checkpoints

checkpoint 直接写本地 NVMe

训练被拖慢,十次里有三次不是卡的问题,是 checkpoint 写错了地方。

要保存的东西32B 级体积写到哪里价格
全参 checkpoint(含优化器状态)约 512 GB本地 NVMe,只留最近 2–3 份已含
仅 bf16 权重(推理用)约 64 GB本地 NVMe,训完再上传已含
LoRA adapter几十 MB 至 1 GB随手 rsync 回本地都行已含
数据集与长期归档按实际持久化存储卷 / S3 兼容对象存储₮0.08 / ₮0.015 每 GB 月
# 单卡 QLoRA:7B 级 Qwen,一张 24GB 的 RTX 4090 就够
$ gpuli create --gpu 4090 --region LAS-1 --image pytorch-2.5-cu124 --cycle week

# 输出目录指向实例本地 NVMe,不要指向挂载的网络存储卷
$ export OUTPUT=/data/ckpt/qwen-lora
$ torchrun --nproc_per_node 1 train.py \
    --load_in_4bit --lora_rank 64 --gradient_checkpointing true \
    --bf16 --per_device_train_batch_size 1 --gradient_accumulation_steps 16 \
    --max_seq_length 2048 --save_steps 500 --save_total_limit 3 --output_dir $OUTPUT

# 8 卡 H100 全参:ZeRO-3,优化器状态 offload 到 1,600 GB 主机内存
$ deepspeed --num_gpus 8 train.py --deepspeed ds_zero3_offload.json --bf16

# 训完再一次性归档到对象存储,用所在机房的内网端点,不占公网出口
$ aws --endpoint-url https://s3-internal.dfw1.gpuli.com s3 sync /data/ckpt s3://qwen-runs/
为什么强调本地盘:32B 全参一份 checkpoint 是 512 GB,save_steps 设 500 又往网络存储卷写,训练进程就要在写盘上干等几十分钟,8 张 H100 跟着空转。
关于到期:到期前 3 天与 1 天有邮件提醒,停机后数据保留 7 天,过期不续会连 checkpoint 一起清掉。
Cost Example

成本示例:8 卡 H100 跑一个月

32B 级全参微调的典型配置,一整月的完整账单,没有隐藏项。

H100 详情 →
项目规格30 天费用
8 × NVIDIA H100 SXM 月租640 GB 显存 · NVLink 全互联 · 160 vCPU / 1,600 GB 内存₮14,432
持久化存储卷2,000 GB · ₮0.08 / GB / 月,放数据集₮160
对象存储1,000 GB · ₮0.015 / GB / 月,归档 checkpoint₮15
出口流量25 Gbps 共享,不限量₮0
公网 IPv4 与快照1 个 IPv4 + 1 份快照,额度内₮0
合计含存储折合每卡每小时 ₮2.54,纯卡租金 ₮2.51;双节点另加 InfiniBand ₮600 / 节点 / 月₮14,607

这 720 小时够跑多少轮

32B 全参、2,000 万 token 跑 3 个 epoch,按 6ND 约 1.15×1019 FLOPs,8 卡 H100 取 30% 有效算力,单次约 1.5 小时。量级估算差两三倍很正常,就算按 5 小时算,一个月也够跑上百轮。

为什么按月租更适合微调

吃掉时间的不是那一次训练,而是反复调参的循环。价格锁死之后卡闲着还是转着都一样,你才敢把学习率、rank 和数据配比扫一遍。细账见平台对比

这四种情况,别在我们这儿开月租

一天只跑两三小时

最短周期 7 天,关机也照扣。用量零散的话按秒计费平台更省,那是它们的主场,细账见按月与按小时

只想试一次 LoRA

周租 RTX 4090 ₮109 / 7 天,7B 级 QLoRA 约 15–30 小时跑完一轮,够用了。

要交互式改代码

国内往返 140–190 ms,逐字符回显和 Jupyter 拖拽都拖手,代码在本地写完再同步,见延迟与线路

需要发票报销

只收加密货币,开不出任何形式的发票,只能导出充值与消费明细 CSV。

三个可叠加的省钱项:首充满 ₮500 自动加赠 5%;推广返佣终身返 15%,名下月消费合计过 ₮10,000 升到 20%;实例创建后 1 小时内可无理由退款到余额。丑话在前:退款与赠额都只回到钱包,充值余额不能提现,只有返佣可每周提一次 USDT(最低 ₮50),别一次充远超预算的量。付款方式见加密货币付款说明,注册流程见无需实名说明
FAQ

微调选卡常见问题

帮助中心 →
微调 Qwen 7B,一张 RTX 4090 真的够吗?
QLoRA 够,余量还不小:4-bit 底座约 4 GB,加上 LoRA 参数、优化器与激活,序列 2048、micro-batch 1 时峰值约 8–12 GB。bf16 底座的 LoRA 要 20–26 GB,24 GB 就很紧,建议换 32 GB 的 RTX 5090(₮499)或 48 GB 的 L40S(₮649)。全参 7B 不是 4090 的活,至少要 80 GB 单卡。
LoRA 和全参微调,效果到底差多少?
要看任务。指令跟随、风格适配、垂直问答这类只调输出方式的任务,rank 取到 64 甚至 128 并挂满全部线性层,效果通常很接近全参。要注入大量新知识、改变行为分布,全参明显更好。成本差 30–40 倍,先用周租卡把 LoRA 的天花板测出来更务实。
你们的卡之间有 NVLink 吗?4090 多卡能训练吗?
H100 SXM、H200、B200、A100 SXM、MI300X 这些 SXM / OAM 卡在同节点内 NVLink 全互联;A6000、A40、RTX 6000 Ada 双卡可 NVLink 桥接;L40S 与 RTX 4090 / 5090 / 3090 走 PCIe 交换,没有 NVLink。4090 多卡跑数据并行或 ZeRO-2 可以,ZeRO-3 会明显掉速,最好一张卡一组独立实验。
训练跑到一半实例出问题,checkpoint 会丢吗?
本地 NVMe 上的 checkpoint 会随实例迁走,但训练进程一定会断。我们承诺硬件故障 30 分钟内迁移或更换,SLA 是每实例每月 99.9%,未达标按停机时长补 3 倍(低于 99% 补 10 倍,低于 95% 全月免费),30 天内经工单申请。所以 save_steps 一定要设,save_total_limit 设 2–3 自动淘汰旧档。
能按小时租吗?我的任务两天就跑完了。
不能,只有周租 7 天和月租 30 天,下单时从钱包余额一次性扣除,周期内价格锁死。两天的任务就直接买周租,多出来的 5 天正好留给评测和二次调参:7B 的 QLoRA 用 RTX 4090 是 ₮109,7B 全参用 A100 SXM 是 ₮319,8 卡 H100 一周 ₮4,172。创建后 1 小时内可无理由退款换卡。
从国内往实例传 200 GB 训练数据要多久?
入方向不收费也不限量,瓶颈几乎总在你本地上行带宽与跨境线路,我们给不出确定时间。先打包成 tar 或 parquet 再传,小文件多时 rsync 的元数据开销比传输本身还大;公开数据集直接在实例里从源站下载。数据放进存储卷(₮0.08 / GB / 月,2,000 GB 每月 ₮160),换实例重新挂载即可。

先用一张周租 4090 把 LoRA 跑通。

₮109 / 7 天起,邮箱注册,USDT 充值,约 3 分钟拿到 SSH。确认要上全参再换 8 卡 H100。

本页最后更新: · 价格与库存以 GPU 租用价格 页为准

Telegram
Telegram 客服@gpuli_cn7×24 小时在线
工单