首页/GPU 租用/SD 与 FLUX 出图

STABLE DIFFUSION GPU RENTAL

SD / SDXL / FLUX 云端显卡租用与炼丹指南

本地那张卡跑 SDXL 已经吃力、跑 FLUX 直接爆显存,是大多数人开始找 SD 云端显卡的理由。这页把出图与炼丹的显存账、单张耗时、每千张成本和模型库怎么存都算给你看。RTX 4090 月租 ₮369 起,USDT 付款,邮箱注册即可开机。

一句话回答:出图与炼丹的主力是 RTX 4090 24GB,月租 ₮369,SDXL 出图和 LoRA 训练都够用;FLUX.1 dev 走 FP16 权重时显存吃紧,RTX 5090 32GB 月租 ₮499 更稳,出图约快 1.7 倍;要长期对外提供出图服务、需要多个模型常驻显存,选 L40S 48GB 月租 ₮649。三款都有 ComfyUI 预装镜像,模型放持久化存储卷即可跨实例复用。
Pick Your Card

按任务选卡速查表

显存峰值为 fp16 精度、ComfyUI 默认参数下的实测区间,含 VAE 解码那一瞬间的尖峰。爆不爆显存看的是峰值,不是权重体积。

全部 16 款报价 →
任务显存峰值推荐卡型月租周租说明
SD 1.5 / 2.1 出图
512–768 px
4–6 GBRTX A5000 24GB₮219₮65最便宜的入门档,跑老模型和插件生态完全够
SDXL 出图 + Refiner
1024 px · batch 1
9–11 GBRTX 4090 24GB主力₮369₮109性价比最高的一档,四个机房都有货
SDXL 批量 / 高清修复
batch 8 或放大到 2048
16–20 GBRTX 4090 24GB₮369₮10924GB 刚好接得住;再叠 ControlNet 就该换 32GB
FLUX.1 schnell 出图
4 步 · fp8 或 fp16
14–24 GBRTX 4090 24GB₮369₮109步数少,24GB 够用,出一张图 4 秒出头
FLUX.1 dev FP16 常驻
1024 px · 20 步
33–34 GBRTX 5090 32GB推荐₮499₮14924GB 卡要反复换入换出权重,32GB 换入次数骤减
SDXL LoRA 训练
rank 32 · batch 2 · 梯度检查点
18–20 GBRTX 4090 24GB₮369₮109最常见的炼丹场景,一次训练不到一小时
FLUX LoRA 训练
rank 16 · 8-bit Adam
26–28 GBRTX 5090 32GB₮499₮14924GB 必须换量化底模,且随时可能 OOM
多模型常驻的出图服务
FLUX + SDXL + ControlNet
38–46 GBNVIDIA L40S 48GB₮649₮189切模型不用重新读盘,ECC 显存,为 7×24 设计
SDXL 全参微调
优化器状态占大头
45–60 GBA100 PCIe 80GB₮899₮269这一步已经不算出图,属于训练任务
先看峰值再看权重。按「模型文件多大」估显存,开机就会 OOM。峰值来自三处:文本编码器与主干同时驻留的那一刻、注意力的中间张量、以及 VAE 把 latent 解码回 1024×1024 的瞬间——最后这一下能顶掉 3–5 GB,用 tiled VAE 可以压下去但会慢一点。选卡给峰值留 15% 余量,比事后调参省事。
Throughput & Cost

出图速度与每千张成本

SDXL 口径:1024×1024、30 步、DPM++ 2M Karras、batch 1、fp16。FLUX.1 dev 口径:1024×1024、20 步、fp16。数据为我们在 DFW-1 机房实测的中位值,换采样器、开 ControlNet、换社区模型都会有出入,只作横向比较用。

成本计算指南 →
卡型显存月租SDXL 单张FLUX.1 dev 单张SDXL 满负荷 24 小时SDXL 每千张FLUX 每千张
RTX A5000
Ampere · PCIe4
24 GB₮21911.0 s48 s7,850 张₮0.93₮4.06
RTX 3090
Ampere · PCIe4
24 GB₮2497.5 s34 s11,520 张₮0.72₮3.27
RTX 4090性价比
Ada · PCIe4
24 GB₮3694.2 s21 s20,570 张₮0.60₮2.99
RTX 5090新品
Blackwell · PCIe5
32 GB₮4992.6 s12 s33,230 张₮0.50₮2.31
RTX A6000
Ampere · PCIe4
48 GB₮3897.9 s26 s10,940 张₮1.19₮3.90
NVIDIA L40S
Ada · PCIe4
48 GB₮6495.1 s17 s16,940 张₮1.28₮4.26
RTX 6000 Ada
Ada · PCIe4
48 GB₮5794.3 s15 s20,090 张₮0.96₮3.35
NVIDIA H100 PCIe
Hopper · PCIe5
80 GB₮1,5492.3 s8.5 s37,560 张₮1.37₮5.08
  • 纯出图不要租 H100。它速度最快,但每千张 SDXL 成本是 4090 的 2.3 倍。扩散模型卡在显存带宽和 UNet 的串行步数上,不是训练卡那种大规模并行算力。同样预算租四张 4090,日产能是一张 H100 的 2.2 倍。
  • 5090 的单张成本其实最低。₮0.50 / 千张比 4090 便宜 17%,因为它快得比贵得多。但它只在 DFW-1 与 ORD-1 有货且库存偏紧,RTX 4090 四个机房随开随有。产能压力不大时,4090 仍是更省心的默认选择。
  • 48GB 那三张卡不是买速度。A6000、L40S、6000 Ada 的每千张成本都高于 4090,它们值钱的是显存容量与 ECC,能让 FLUX 整套常驻、切工作流不重新读盘。给客户跑长期服务选它们,自己出图不必。
  • 表里是满负荷值。真实使用中调提示词、切模型、人工挑图会吃掉大量时间,实际产能通常只有表值的 20%–50%,除非你靠脚本无人值守跑。
VRAM Budget

FLUX 的显存账,为什么 24GB 会卡

FLUX.1 dev 是目前最容易把人逼到换卡的模型。把它拆成几块看,就知道 24GB、32GB、48GB 各自意味着什么。

24 GB

RTX 4090 / 3090 / A5000

靠顺序加载硬撑。FLUX.1 dev 主干 fp16 就要 23.8 GB,加上 T5-XXL 编码器 9.8 GB、CLIP-L 与 VAE,全套常驻需要 33–34 GB。

  • 能跑,但要换入换出。先算文本编码再卸载,然后加载主干,每张图多一次 PCIe 传输
  • 换 fp8 主干可压到 11.9 GB,速度回来了,细节和文字渲染略有损失
  • SDXL 完全没问题,峰值 9–11 GB,24GB 还能同时挂 ControlNet
  • 月租 ₮369(4090)· 每千张 SDXL ₮0.60
32 GB

RTX 5090

主干 fp16 可以常驻,只有文本编码器需要短暂让位,换 fp8 版 T5(4.9 GB)后整套塞得下。换入换出次数骤减,这是 1.7 倍速度差的来源。

  • FLUX.1 dev 21 s → 12 s,同样是全精度主干
  • FLUX LoRA 训练峰值 26–28 GB,这一档是最低门槛
  • SDXL 高分辨率放到 2048 加 ControlNet 也不紧张
  • 月租 ₮499,仅 DFW-1 与 ORD-1 有货,库存偏紧
48 GB

L40S / A6000 / RTX 6000 Ada

FLUX.1 dev 加 T5-XXL 全套 fp16 常驻后还剩十几 GB,够再挂三四个 LoRA、一个 ControlNet 和一份 SDXL,服务端不必为显存写调度逻辑。

  • 多模型常驻,请求打过来直接算,省掉每次几秒的读盘
  • ECC 显存与企业级散热,连续跑一个月不用担心
  • 单张速度不如 4090,L40S 的 SDXL 是 5.1 s 对 4.2 s,这点要认
  • 月租 ₮649L40S)· ₮389(A6000)· ₮579(6000 Ada)
量化不是免费的。把 FLUX 主干换成 fp8 或 nf4,显存能砍掉一半以上,24GB 卡也能顺畅跑。代价有两处:画面里的文字和招牌容易糊,同一个种子在不同量化方案下出图不一致,商业交付时批次之间对不上。产出要求稳定复现的话,宁可加 ₮130 上 RTX 5090。顺带一提,出图之后想跑 Wan、混元这类视频模型,显存账是另一套算法,见AI 视频生成选卡
Image & Storage

ComfyUI 镜像与模型库怎么放

开机就能用的是镜像,值钱的是模型库。把这两件事分开处理,换卡和重开实例就不再是灾难。

使用文档 →

镜像负责开机,存储卷负责积累

下单时在镜像列表里选 ComfyUIAutomatic1111,驱动、CUDA 12.4、PyTorch 2.5、xformers 与常用节点都装好,3 分钟内交付;想从头搭就选 Ubuntu 22.04 裸机,驱动同样现成。镜像里的 ComfyUI 只监听 127.0.0.1:8188,公网扫不到,靠 SSH 本地端口转发打开界面——建实例、装自定义节点、几个人共用一台的完整步骤在 ComfyUI 云端部署 那页,本页只谈模型库。

模型别放系统盘,也别用软链接覆盖 models 目录——镜像升级时容易被整个盖掉。ComfyUI 原生支持 extra_model_paths.yaml,把 base_path 指到存储卷的挂载点,checkpoints、loras、unet、vae 一次配好;换卡、换实例只要重新挂上同一块卷。

装什么模型、出什么图,我们不过问。没有进程扫描、没有内容审核,运维只看得到 GPU 温度、功耗与链路状态,你的 checkpoint 名字和出图内容在我们系统里没有对应字段可记,详见无需实名说明。收到有效的滥用投诉仍会按服务条款先通知、给整改期限。
# 存储卷挂到 /data,模型只下一次,换实例重新挂上即可
mkdir -p /data/models/{checkpoints,loras,vae,clip,unet,controlnet}

# 拉 FLUX.1 dev 主干 23.8 GB,25 Gbps 出口实测约 3 分钟
huggingface-cli download black-forest-labs/FLUX.1-dev \
  flux1-dev.safetensors --local-dir /data/models/unet

# 多卡机一卡一进程,端口错开,前面自己挂队列分发
for i in 0 1 2 3; do
  CUDA_VISIBLE_DEVICES=$i python main.py --listen 127.0.0.1 \
    --port $((8188+i)) --output-directory /data/output/gpu$i &
done

# 成品图归档到对象存储 ₮0.015/GB/月,出口不收流量费
aws --endpoint-url https://s3.dfw1.gpuli.com \
  s3 sync /data/output/ s3://my-renders/2026-09/

模型库的体积与花费

文件体积说明
FLUX.1 dev 主干 fp1623.8 GBfp8 版本约 11.9 GB,schnell 体积相同
T5-XXL 文本编码器 fp169.8 GBFLUX 与部分 SD3 工作流共用,fp8 版约 4.9 GB
SDXL base + refiner13.0 GB6.9 GB + 6.1 GB
社区微调 checkpoint2–7 GB / 个收集癖发作的话,几十个就上百 GB
ControlNet 模型1.4–2.5 GB / 个depth、canny、openpose 一般都要备齐
LoRA20–400 MB / 个数量多但不占地方
一个用了半年的模型库300–800 GB这就是为什么不能放系统盘
  • 系统盘装不下。4090 与 5090 实例的系统盘是 500 GB NVMe,3090 与 A5000 只有 250 GB,模型库过百 GB 后会被权重、缓存和输出一起挤满。加一块持久化存储卷挂在 /data₮0.08 / GB / 月,500 GB 是 ₮40,1 TB 是 ₮80,相对 ₮369 的卡钱不算什么。
  • 存储卷比实例活得久。卷是独立资源,实例到期、退租、换卡都不影响它,下个月从 4090 换到 5090,挂上同一块卷模型全在。第一次下载也不慢:25 Gbps 出口不限流量、不收流量费,拉 23.8 GB 的 FLUX.1 dev 实测 3 分钟左右。
  • 出图产物用对象存储归档。₮0.015 / GB / 月,1 TB 成品图一个月 ₮15,标准 S3 协议,rclone 与 boto3 直接可用。日产两万张时磁盘涨得很快,定期 sync 出去比扩容存储卷便宜五倍多。
Fine-tuning

炼丹:LoRA、DreamBooth 与全参微调

群里说的「炼丹」九成是练 LoRA。它其实是这几件事里最便宜的一件,贵的是后面两件。

更多解决方案 →
训练类型典型设置显存峰值推荐卡单次耗时机时成本
SD 1.5 LoRA30 张图 · rank 16 · 1,500 步8–10 GBRTX A5000 ₮219 / 月约 26 分钟₮0.13
SDXL LoRA
最常见
30 张图 · 1024 px · rank 32 · batch 2 · 1,500 步18–20 GBRTX 4090 ₮369 / 月约 55 分钟₮0.47
SDXL LoRA(快)同上,batch 424–27 GBRTX 5090 ₮499 / 月约 33 分钟₮0.38
FLUX LoRArank 16 · 1024 px · 8-bit Adam · 梯度检查点 · 2,000 步26–28 GBRTX 5090 ₮499 / 月约 3.5 小时₮2.43
SDXL DreamBooth 全量fp16 权重 + Adam 优化器状态45–60 GBA100 PCIe 80GB ₮899 / 月6–14 小时₮7.5–17.5

机时成本 = 月租 ÷ 720 小时 × 实际耗时,不含数据准备与调参的时间。耗时按单卡、无干扰、数据已放在本地 NVMe 上测得。

  • 炼丹不要按次算账。一次 SDXL LoRA 的机时成本不到半个 U,真正的开销是租期本身:RTX 4090 周租 ₮109、月租 ₮369,你付的是这段时间的独占,跑 1 次和跑 30 次一个价。
  • 数据准备别在 GPU 实例上做。打标、裁切、清洗是 CPU 活,占着一张 4090 干这个是浪费。先在本地整理好数据集,用 rsync 推到实例的存储卷,卡只用来跑训练。
  • 全参微调当训练任务看。SDXL 全量 DreamBooth 光优化器状态就要 30 GB 以上,48GB 卡常常不够。这时候该看 A100 80GB(PCIe 月租 ₮899),而不是继续在消费卡上抠梯度检查点。
  • 训练完立刻做快照。每台实例含 1 份免费快照额度,跑通一版权重先打快照,调坏了随时回滚。快照与存储卷是两套东西,重要的权重两边都留一份。
Production

对外出图服务与多卡扩容

给客户跑、接在自己产品后面、或者做批量代出图,考虑的东西和自己玩不一样:稳定性、并发、显存常驻、固定入口。

多卡整机说明 →
配置显存合计互联月租SDXL 满负荷 24 小时适合
1 × RTX 409024 GB单卡₮36920,570 张个人与小工作室的默认起点
2 × RTX 409048 GBPCIe 4.0 交换₮73141,140 张一卡跑服务、一卡跑训练,互不干扰
2 × RTX 509064 GBPCIe 5.0 交换₮98866,460 张FLUX 为主的高质量出图管线
4 × RTX 409096 GBPCIe 4.0 交换₮1,44682,280 张四进程并行,产能优先
4 × NVIDIA L40S192 GBPCIe 4.0 交换₮2,54467,760 张多模型常驻的商用出图 API
8 × RTX 4090192 GBPCIe 4.0 交换₮2,804164,560 张批量代出图,8 卡整机省 5%
消费卡多卡不能合并显存。RTX 4090、5090、3090 走 PCIe 交换,没有 NVLink,四张 4090 不等于一张 96GB 的卡;出图恰好不需要合并,一卡一进程加个队列分发就够用。多卡倍率 2 卡 ×1.98、4 卡 ×3.92、8 卡 ×7.6,8 卡整机省 5%。
  • 固定公网 IP 与端口直通。每台实例默认含 1 个美国 IPv4,除 SSH 外端口 1:1 直通,可以把域名 A 记录解析过来,前面套 Nginx 加 TLS 与鉴权。额外 IP ₮4 / 个 / 月,最多 4 个;停机与 7 天保留期内 IP 不变。
  • 用 API 做自动化。开机、关机、快照、查余额都能通过 https://api.gpuli.com/v2 调用,密钥形如 gpuli_live_…;命令行工具 gpulipip install gpuli-cli 安装。队列空了自动打快照、余额低于阈值发告警,几十行脚本能搞定。
  • SLA 与选点。每实例每月 99.9%,未达标按停机时长 3 倍补偿(低于 99% 补 10 倍,低于 95% 当月免费),硬件故障 30 分钟内迁移或更换,近 12 个月全站可用性 99.95%。4090 与 L40S 四个机房都有货,5090 只在 DFW-1 与 ORD-1;对交互延迟敏感选 LAS-1(香港 142 ms,全站最低),详见延迟与线路说明
Honest Limits

这几件事我们做不好

出图这个场景里,我们有几处明显的不方便。先说清楚,比你付完钱再发现好。

01

ComfyUI 网页拖节点会迟滞

机房全在美国,从中国大陆访问往返 140–190 ms。出图计算在服务器端完成,单张耗时不受影响;但画布交互、节点拖动、参数滑块每次操作都要走一个往返,手感不如本地。

02

没有按小时计费

最短一个周期是 7 天。一周只出几十张图、一个月开机两三次的话,在我们这里等于为闲置时间付钱,按秒计费的平台更合适,这一点我们不争。盈亏平衡点算在包月还是按小时,横向报价见平台对比

03

只收加密货币,不开发票

USDT、USDC、BTC、ETH、XMR、LTC、SOL,不收支付宝、微信和银行卡,也开不出人民币发票。另外充值进来的余额不可提现,只有推广返佣能提,请按实际需要充值。细节见加密货币付款说明

还有两条:实例创建后 1 小时内可无理由退款到钱包余额,所以第一小时请把出图和训练都真跑一遍;到期停机后数据保留 7 天,重要的权重和成品图记得提前同步到对象存储。

FAQ

SD 云端显卡常见问题

帮助中心 →
跑 SDXL 到底要多大显存?24GB 的 RTX 4090 够吗?
够,而且余量不小。SDXL 1024×1024、batch 1、带 refiner 的显存峰值在 9–11 GB;batch 8 或者高清修复放大到 2048 时峰值升到 16–20 GB,24GB 仍然接得住。只有在同时挂多个 ControlNet 又开大 batch 时才会紧张。RTX 4090 月租 ₮369、周租 ₮109,单张图 4.2 秒,是我们这里出图性价比最高的一档。
FLUX.1 dev 一定要 32GB 吗?4090 能不能跑?
4090 能跑,只是会慢。FLUX.1 dev 主干 fp16 是 23.8 GB,加上 T5-XXL 文本编码器 9.8 GB,全套常驻需要 33–34 GB,24GB 卡必须靠顺序加载:先算文本编码再卸载,然后换入主干,每张图多一次权重传输,实测 21 秒一张。RTX 5090 的 32GB 能让主干常驻,同样参数 12 秒一张,约快 1.7 倍,月租 ₮499、周租 ₮149。另一条路是换 fp8 量化主干(11.9 GB),速度回来了但文字渲染细节会有损失。
模型文件放哪里?每次开新实例都要重新下载吗?
不用。加一块持久化存储卷挂到 /data,₮0.08 / GB / 月,500 GB 是 ₮40、1 TB 是 ₮80,再用 ComfyUI 的 extra_model_paths.yaml 把 base_path 指过去。存储卷是独立于实例的资源,实例到期、退租、换卡都不影响它,下个月换成 5090 挂上同一块卷,几十 GB 的底模和一堆 LoRA 全在。第一次下载也不慢:25 Gbps 出口不限流量,拉 23.8 GB 的 FLUX.1 dev 实测约 3 分钟。
租四张 4090,能一起加速同一张图吗?
不能。RTX 4090、5090、3090 走 PCIe 交换、没有 NVLink,四张 4090 是四张独立的 24GB 卡,不是一张 96GB,显存不合并,单张图的扩散步数也没法拆到多卡上并行。好在出图天然是一卡一进程的活:每张卡起一个 ComfyUI 进程、端口错开、前面挂个队列分发,4 × RTX 4090 月租 ₮1,446(4 卡倍率 ×3.92),SDXL 满负荷日产能 82,280 张,正好是单卡的四倍。真正 NVLink 全互联的是 SXM 封装的 H100、H200、A100 SXM 与 MI300X,那是训练大模型的用法,出图用不上。部署细节见 ComfyUI 云端部署
炼一个 SDXL LoRA 大概要多久、多少钱?
30 张图、1024 分辨率、rank 32、batch 2、1,500 步,在 RTX 4090 上约 55 分钟,折合机时成本约 ₮0.47;RTX 5090 上 batch 4 约 33 分钟。但按次算账没有意义:你付的是周租 ₮109 或月租 ₮369 的独占时间,这段时间里跑 1 次和跑 30 次费用完全一样。集中调参的人建议先开周租,7 天足够把一个题材从数据清洗调到收敛,到期升级月租时已付费用按剩余天数折抵。
140–190 ms 的延迟会拖慢出图速度吗?
不会。出图计算全部在服务器端完成,网络延迟只影响你和网页界面之间的交互,不影响单张图耗时和批量吞吐。受影响的是手感:ComfyUI 拖节点、调滑块、Jupyter 里拖文件都会有可感知的迟滞。解决办法是在本地搭好工作流导出 JSON 再上传,或者直接调 /prompt 接口批量提交。对交互延迟敏感的话选 LAS-1 拉斯维加斯,香港往返约 142 ms,比 DFW-1 的 158 ms、ORD-1 的 171 ms、IAD-1 的 186 ms 都低,逐段实测数据见延迟与线路说明

一个邮箱,一笔 USDT,三分钟开始出图。

RTX 4090 月租 ₮369 / 周租 ₮109,ComfyUI 镜像开箱即用。不合适 1 小时内可退款到余额。

本页最后更新: · 价格与库存以 GPU 租用价格 页为准

Telegram
Telegram 客服@gpuli_cn7×24 小时在线
工单