首页/GPU 租用/AI 视频生成选卡

AI VIDEO GENERATION · GPU RENTAL

AI 视频生成租 GPU:万相 Wan、混元视频的显存与选卡

Wan(通义万相)、HunyuanVideo(混元视频)、CogVideoX 这类视频生成模型,卡住你的几乎永远是显存。这一页写清分辨率、帧数与显存的换算,给出每张卡能跑到哪一档、一条片子要跑多久、折成多少钱,以及为什么这种长任务包月比按小时省心。

一句话回答:跑视频生成模型,24GB 显存常常不够——14B 级模型光权重就要 28 GB。稳妥的起步是 L40S 48GB(月租 ₮649)或 A100 80GB(月租 ₮899 起),批量出片再上多卡。这类任务单次要跑十几到几十分钟、模型权重动辄几十 GB,按小时计费的账单很容易失控,按月包卡的成本反而是确定的。
Why VRAM Explodes

分辨率和帧数是怎么把显存吃光的

视频模型和出图模型最大的区别,是它把时间也当成一个维度去做注意力。多加几帧,代价不是线性的。

全部 16 款 GPU 报价 →

主流视频扩散模型先用 3D VAE 把像素压成潜变量:空间压 8 倍、时间压 4 倍,进 DiT 之前再做一次 2×2 patch 化。真正参与注意力计算的 token 数,可以用下面这个式子直接估出来——换一组分辨率和帧数自己算一遍,就知道显存和时间会往哪个方向跑。

# latent token 数(3D VAE 空间 8 倍 + 时间 4 倍下采样,再做 2×2 patch)
tokens = (宽 / 16) × (高 / 16) × ((帧数 - 1) / 4 + 1)

# 例一:832×480、81 帧(约 5 秒 @16fps)
tokens = 52 × 30 × 21 = 32,760

# 例二:1280×720、81 帧 —— 只是分辨率提一档
tokens = 80 × 45 × 21 = 75,600   # token 变成 2.31 倍

# 注意力的计算量与 token 数的平方成正比 → 这一段慢 5.3 倍
# 开了 FlashAttention 之后,激活显存回到线性增长,但时间省不掉
输出规格latent token注意力相对开销14B 模型峰值显存够用的卡
832×480 · 81 帧
约 5 秒 @16fps
32,760约 36–44 GBL40S 48GB 够
832×480 · 161 帧
约 10 秒 @16fps
63,9603.8×约 44–54 GB48GB 吃紧,建议 80GB
1280×720 · 81 帧
约 5 秒 @16fps
75,6005.3×约 46–58 GB48GB 吃紧,建议 80GB
1280×720 · 129 帧
约 8 秒 @16fps
118,80013×约 58–72 GBA100 / H100 80GB
1920×1088 · 81 帧
约 5 秒 @16fps
171,36027×约 76–96 GB要 H200 141GB 或分块

显存为 14B 级模型 bf16 权重常驻、开启 FlashAttention、文本编码器用完即卸载的量级估算,不同框架与优化开关差别可到 ±30%。「注意力相对开销」只描述注意力那一段,整条流水线的实际耗时增长会平缓一些,但方向一致:加帧数比加分辨率便宜,分辨率两边各翻倍等于 token 变四倍、注意力变十六倍。

还有第三个显存尖峰:VAE 解码。扩散跑完后要把 latent 一次性解回像素帧,720p、81 帧的解码峰值经常比扩散过程本身还高,很多人 OOM 就 OOM 在最后这一步。办法是打开 tiled VAE 或分段解码(ComfyUI 里是 VAE Decode (Tiled)),代价是慢十几秒,能省下十几 GB。判断显存够不够要按这个峰值算,不是按扩散阶段的稳态占用算。
Model & Card

常见视频模型对显存的要求

先看你要跑哪个模型,权重体积基本决定了显存的下限;再看你要出什么分辨率,那决定上限。

出图与视频生产方案 →
模型参数量bf16 权重典型输出24 GB 卡48 GB 卡80 GB 卡
Wan 2.1 T2V-1.3B
通义万相 · 轻量档
1.3B约 2.6 GB480p · 5 秒从容从容从容
Wan 2.1 T2V / I2V-14B
通义万相 · 主力档
14B约 28 GB480p–720p · 5 秒要 FP8 量化 + 分块,易 OOM480p 可以,720p 吃紧720p 从容
HunyuanVideo
腾讯混元视频
13B约 26 GB720p · 5 秒要 FP8 量化,稳定性差720p 吃紧从容
CogVideoX-5B
智谱 · I2V / T2V
5B约 10 GB720×480 · 6 秒要开 CPU offload从容从容
Mochi 1
Genmo · 开源权重
10B约 20 GB480p · 5 秒吃紧从容从容
LTX-Video
轻量 · 出预览快
2B约 4 GB768×512 · 快速预览从容从容从容

权重体积按官方 bf16 发布版估算,社区的 FP8 与 GGUF 量化版大约能砍掉一半,代价是画质与跨批次一致性掉一点、长镜头闪烁更明显。别忘了文本编码器:Wan 用的 umT5-XXL 在 fp16 下要 11 GB 左右,若让它常驻显存而不是编码完就卸载,上面每一行都要再加这个数。

按预算与目标分辨率选卡

你的情况推荐卡型显存月租 · 30 天周租 · 7 天折合每小时可用机房
先试水,只跑 480p 小模型RTX 4090
Ada · PCIe4
24 GB₮369₮109₮0.51四个机房都有
预算最紧,但要 48GBNVIDIA A40
Ampere · PCIe4
48 GB₮319₮95₮0.44IAD-1 · LAS-1
48GB 里性价比最高NVIDIA RTX A6000
Ampere · PCIe4
48 GB₮389₮115₮0.54DFW-1 · IAD-1 · LAS-1
用 FP8 量化冲 720pRTX 5090
Blackwell · 原生 FP4/FP8
32 GB₮499₮149₮0.69DFW-1 · ORD-1新品
稳定起步,最省心的一档NVIDIA L40S推荐
Ada · 支持 FP8
48 GB₮649₮189₮0.90四个机房都有
720p 从容 + 训练视频 LoRAA100 PCIe 80GB
Ampere · PCIe4
80 GB₮899₮269₮1.25IAD-1 · LAS-1
接单量大,要吞吐H100 SXM 80GB
Hopper · FP8
80 GB₮1,899₮549₮2.64DFW-1 · IAD-1 · ORD-1
1080p 一次成型不分块NVIDIA H200
Hopper · 141GB HBM3e
141 GB₮2,599₮739₮3.61DFW-1 · ORD-1
两条容易踩坑的提醒。其一,A40 与 A6000 虽然也是 48GB,但架构是 Ampere、没有原生 FP8,跑同一个工作流大约只有 L40S 六成上下的速度;它们适合预算紧、不赶时间的人,要是你在按期交付,多花 ₮260 上 L40S 更划算。其二,RTX 5090 只有 32GB,跑 14B 模型必须量化,而量化本身会让长镜头的稳定性下降;它的强项是 Blackwell 的 FP4/FP8 吞吐,适合已经把工作流调稳的人。
Time & Cost

一条片子要跑多久,折成多少钱

出一张图十几秒,出一条五秒片子十几到几十分钟。把这个数字换算成钱,才知道该租哪张卡。

成本计算指南 →
卡型显存月租折合每小时单条 5 秒 720p 耗时每条成本30 天满负荷可出
RTX 5090
FP8 量化跑
32 GB₮499₮0.6918–28 分约 ₮0.26约 1,900 条
RTX A6000
bf16 · Ampere
48 GB₮389₮0.5436–55 分约 ₮0.41约 950 条
NVIDIA L40S推荐
bf16 / FP8 · Ada
48 GB₮649₮0.9022–35 分约 ₮0.43约 1,500 条
A100 PCIe 80GB
bf16 · Ampere
80 GB₮899₮1.2514–20 分约 ₮0.36约 2,500 条
A100 SXM 80GB
bf16 · NVLink
80 GB₮1,099₮1.5313–18 分约 ₮0.40约 2,750 条
H100 SXM 80GB
FP8 · Hopper
80 GB₮1,899₮2.646–9 分约 ₮0.33约 5,700 条
NVIDIA H200
FP8 · 141GB
141 GB₮2,599₮3.615–8 分约 ₮0.39约 6,600 条

耗时为 14B 级模型、50 步采样、不开蒸馏与步数压缩、单条串行生成的量级参考。换 4 步蒸馏模型可以快五到八倍,换 1.3B 小模型可以快十倍以上,所以这张表用来横向比较卡型,别拿去做交付承诺。「每条成本」= 月租 ÷ 满负荷条数,前提是这张卡 30 天不停在出片。

这张表最反直觉的一点:每条视频的成本几乎是平的,都在 ₮0.26 到 ₮0.43 之间。贵的卡快、便宜的卡慢,摊到单条上差别没你想的大。所以真正决定成本的不是「选哪张卡」,而是「这张卡有多少时间在空转」:一张 H100 每天只跑三小时,单条成本立刻翻到 ₮2.6 以上;一张 L40S 排满队列跑满 30 天,单条就是 ₮0.43。先问自己一天能喂多少条任务,再回头挑卡型。

量大了怎么办:多卡是并行队列,不是并行一条片子

先泼一盆冷水:把一条视频拆到多张卡上并行生成,在大多数现成工作流里做不到。ComfyUI、Diffusers 的默认路径都是单卡跑完一条,除非你上 xDiT / USP 这类序列并行方案,而它们要求卡间有 NVLink 才划算。

所以做批量生产的人,多卡的用法是「一卡一条队列」:四张卡同时跑四个任务,吞吐乘四、单条速度不变。这种用法对互联没有要求,L40S、RTX 4090 这些走 PCIe 交换、没有 NVLink 的卡完全够用,还更便宜。真正需要 NVLink 全互联的是 A100 SXMH100 SXM,用在视频模型的微调上——训练要存优化器状态与梯度,比推理更吃显存,14B 的 LoRA 训练建议从 80GB 单卡起步,全参微调得上 8 卡节点,必要时加 InfiniBand 8 卡节点(₮600 / 节点 / 月)。

多卡配置月租互联与用法
2 × RTX 4090₮731PCIe 交换,无 NVLink · 两条 480p 队列
4 × RTX 4090₮1,446480p 批量出片最便宜的组合
2 × L40S₮1,285PCIe 交换 · 约 3,000 条 / 月
4 × L40S₮2,544约 6,000 条 / 月,工作室常用
8 × L40S₮4,9328 卡整机省 5%
4 × A100 PCIe 80GB₮3,524双卡可 NVLink 桥接 · 720p 队列
8 × H100 SXM₮14,432NVLink 全互联 · 视频模型微调

多卡倍率:2 卡 ×1.98、4 卡 ×3.92、8 卡 ×7.6。多卡为同一台物理机内的卡,不是拼凑的多台实例。

Why Monthly

视频这种长任务,为什么按月包卡更合算

出图任务可以「用完就关」,视频任务往往关不掉。下面五条是我们工单里最常听到的迁移理由。

与按秒计费平台的完整对比 →
  • 单次任务不能中断。一条 8 秒 720p 在 L40S 上要跑将近一小时。用可抢占档位跑到第 50 分钟被顶掉,钱照付、片子没有。我们没有竞价机制也没有 spot 档位,付费周期内整卡独占,除硬件故障外不回收、不降频、不迁移。
  • 模型权重太大,冷启动本身就在烧钱。Wan 14B 一整套(DiT + umT5-XXL + VAE)落盘 60–80 GB,HunyuanVideo 相当。按小时开关机,每次重新拉权重要二三十分钟,卡在转、钱在扣;一个月开关十几次,光冷启动就吃掉几个小时机时。包月的机器权重一直躺在 NVMe 上,重启即用。
  • 视频生产是队列式的。真实节奏是白天调 prompt 和参考图、晚上挂一整夜批量渲染、第二天挑片重跑。卡基本闲不下来,「用完就关」在这里不成立。
  • 失败重试的成本极高。OOM、采样出 NaN、VAE 解码爆显存、种子不理想——视频的重跑率比出图高得多,一次重试就是几十分钟。按小时计费时每次失败都写进账单;包月只消耗时间,不额外产生费用。
  • 按条报价的生意需要固定成本。月租在下单时从余额一次性扣除、周期内价格锁死,不随时段和供需浮动,你可以直接把 ₮649 ÷ 当月出片数量写进报价单。
自己算一遍,别听我们说。把月租折成每小时:L40S ₮0.90、A100 80GB ₮1.25、A100 SXM ₮1.53、H100 SXM ₮2.64、H200 ₮3.61,拿这几个数字和你现在按小时付的单价直接比,再乘上本月真正让卡转起来的小时数。一个月只出十几条片子的话,包月是亏的——那就老实用按秒计费平台,或者先开一个周租(L40S ₮189 / 7 天、A100 PCIe ₮269 / 7 天)跑一周看实际占用。实例创建后 1 小时内不合适可无理由退款到余额。
Storage

素材、权重和成片分别放在哪

视频的存储压力比出图大一个量级:一条 5 秒 720p 的无损帧序列就能到几个 GB。放错地方,要么塞爆系统盘,要么到期一起没了。

使用文档 →
01 · 模型权重

放系统盘

L40S、5090、A6000 自带 500 GB NVMe,A100 80GB 与 H100 是 1 TB。Wan 14B 全套 60–80 GB,500 GB 大概装三套主力模型。权重是随机小块读,必须放本地 NVMe,别放对象存储再挂载。

02 · 训练素材

放持久化存储卷

₮0.08 / GB / 月,1 TB 是 ₮80。适合反复随机读的视频 LoRA 训练集、帧序列与标注文件。存储卷独立于实例生命周期,换卡、重装镜像都不影响里面的数据。

03 · 成片与归档

放对象存储

₮0.015 / GB / 月,1 TB 只要 ₮15,比存储卷便宜五倍多。走标准 S3 协议,端点 s3.dfw1.gpuli.com,实例内用 s3-internal 走内网更快。出口不限流量,客户取片不额外收钱。

这条最重要:到期停机后,数据只保留 7 天。月租到期未续费,实例停机进入 7 天保留期,磁盘和公网 IP 都还在,续费即恢复;7 天之后释放,谁也找不回来。成片就是你的交付物,请把输出目录持续同步到对象存储。我们会在到期前 3 天和 1 天各发一封邮件提醒,但提醒是提醒,同步脚本才是保险。
# 出片自动同步:跑在 tmux 里,每 5 分钟把 ComfyUI 的 output 推到对象存储
export EP=https://s3.dfw1.gpuli.com

while true; do
  aws --endpoint-url $EP s3 sync \
    /workspace/ComfyUI/output/ s3://video-out/2026-09/ --only-show-errors
  sleep 300
done

# 拉参考素材:实例内务必用内网端点,比公网快且不占出口带宽
aws --endpoint-url https://s3-internal.dfw1.gpuli.com \
  s3 sync s3://assets/ref-clips/ /workspace/ref/

# 换机 / 续费前,确认两边条数一致再释放旧实例
ls /workspace/ComfyUI/output/*.mp4 | wc -l
aws --endpoint-url $EP s3 ls s3://video-out/2026-09/ | wc -l

预装镜像可直接选 ComfyUI(含 ComfyUI-Manager,端口 8188,不含模型权重)或 PyTorch 2.5 + CUDA 12.4 自己搭。aws-clircloneboto3 都能读写对象存储,桶与访问密钥在控制台创建。Jupyter 在 https://实例ID.jup.gpuli.com,SSH 端口 22000–22999。

Before You Rent

租之前该知道的几件不那么好听的事

视频生成这个场景里我们有几个具体短板,写在前面比事后解释强。

延迟与线路实测 →

ComfyUI 的网页操作会有迟滞

四个机房全在美国本土,从中国大陆访问的往返延迟 140–190 ms,LAS-1 拉斯维加斯最低(约 142 ms)。跑任务完全不受影响,但在浏览器里拖节点、连线、拉滑块有肉眼可感的粘手感。稳妥做法是本地编好工作流 JSON 传上去跑批,或用 API 模式提交队列。

成片要下载才能看

25 Gbps 共享出口不限流量,拉一条几十 MB 的成片是几秒钟的事;但想在网页里逐帧刮擦 1080p,体验会很差。建议同时输出低码率预览版,拉回本地挑片,选定后再下成片。

最短一个周期是 7 天,没有按小时

关机、出差、这周没接到单,租金照扣。视频生成偏偏是个「有单就爆满、没单就闲置」的行当,接单节奏断续的话请认真算一下闲置成本,或者干脆用按秒计费的平台。这是我们做不到的事。

只收加密货币,开不出发票,余额不可提现

只接受 USDT、USDC、BTC、ETH、XMR 等,不收支付宝、微信与银行卡,也开不出增值税发票——控制台能导出含链上哈希的充值与消费明细,但那不是税务意义上的发票。充值进来的余额只能继续用于消费,不能提现,只有推广返佣可以每周提现为 USDT、最低 ₮50,所以请按实际用量分批充值。另外 Windows Server 2022 镜像(₮25 / 月)只提供给 PCIe 卡型,SXM 卡型没有 Windows。

付款细节见加密货币付款说明,注册与身份要求见无需实名说明——注册只要一个邮箱,Proton、Tuta 这类匿名邮箱也接受。

FAQ

AI 视频生成租卡常见问题

帮助中心 →
24GB 的 RTX 4090 到底能不能跑视频生成?
能跑,但范围很窄。Wan 2.1 的 1.3B 版本、LTX-Video、CogVideoX-5B 开 CPU offload,在 24GB 上出 480p 短片没问题,速度也够快。但主流的 14B 级模型(Wan 14B、HunyuanVideo)光 bf16 权重就 26–28 GB,24GB 根本装不下,必须上 FP8 或 GGUF 量化再配合分块 VAE 解码,能不能跑通取决于你用哪个框架、哪个量化版本,OOM 是常态,长镜头的画面稳定性也会掉。如果你的目标就是 480p 试水或做预览,RTX 4090 月租 ₮369 是最便宜的路;只要你打算认真出 720p,请直接从 48GB 起步。
Wan 万相 14B 和混元视频需要多大显存?
按峰值算,不是按权重算。bf16 权重是 28 GB(HunyuanVideo 约 26 GB),加上文本编码器 umT5-XXL 的 11 GB(用完可以卸载)、扩散阶段的激活,以及最后 VAE 解码那一下的尖峰。实际结果:480p、81 帧大约 36–44 GB,L40S 48GB 够;720p、81 帧大约 46–58 GB,48GB 会吃紧,建议 A100 80GB;720p、129 帧要 58–72 GB;1080p 基本要 76 GB 以上,除非用 H200 141GB,否则必须分块。这些是量级估算,不同框架和优化开关能差 ±30%。
生成一条 5 秒视频要多久、要花多少钱?
以 14B 级模型、720p、81 帧、50 步采样、不开蒸馏加速为基准:L40S 约 22–35 分钟,A100 80GB 约 14–20 分钟,H100 SXM 约 6–9 分钟,H200 约 5–8 分钟。折成每条成本,反而都落在 ₮0.26 到 ₮0.43 这个很窄的区间里——贵的卡快,便宜的卡慢,摊到单条上差别不大。真正拉开成本的是卡的空转时间:一张 H100 每天只跑三小时,单条成本会翻到 ₮2.6 以上。换成 4 步蒸馏模型可以快五到八倍,这张账要重算。
多卡能让单条视频生成得更快吗?
默认情况下不能。ComfyUI 和 Diffusers 的常规路径都是一条视频在一张卡上跑完,多卡不会自动加速单条。要把一条视频拆到多卡,需要 xDiT / USP 这类序列并行方案,而且卡间要有 NVLink 才划算——也就是 A100 SXM、H100 SXM 这类卡。绝大多数人的多卡用法是「一卡一条队列」:四张卡同时跑四个不同任务,吞吐乘四、单条速度不变,这种用法对互联没要求,L40S、RTX 4090 这些走 PCIe 交换、没有 NVLink 的卡完全够用,也更便宜。4 × L40S 月租 ₮2,544,满负荷约 6,000 条 / 月。
素材和成片放在哪?实例到期数据会不会丢?
模型权重放系统盘的 NVMe(L40S 自带 500 GB,A100 80GB 与 H100 是 1 TB);训练素材放持久化存储卷 ₮0.08 / GB / 月;成片归档放对象存储 ₮0.015 / GB / 月,1 TB 只要 ₮15,走标准 S3 协议,出口流量不额外收费。关于到期:月租到期未续费会停机,进入 7 天数据保留期,磁盘与公网 IP 都保留,续费即恢复;7 天之后释放,无法找回。到期前 3 天和 1 天我们各发一封邮件提醒,但请务必自己挂一个同步脚本把输出目录持续推到对象存储。
我接单是断续的,一个月只做十几条片子,还适合包月吗?
不适合,我们不建议。L40S 月租 ₮649 折合每小时 ₮0.90,一个月只跑二三十小时的话,你在为大量闲置时间付钱,按秒计费的平台会明显更省。折中的做法是先开一个周租跑一周看看真实占用:L40S ₮189 / 7 天、A100 PCIe ₮269 / 7 天、RTX 4090 ₮109 / 7 天。周租 7 天、月租 30 天都是下单时从钱包余额一次性扣除、周期内价格锁死;实例创建后 1 小时内不合适还能无理由退款到余额。有一点要先说清楚:充值进来的余额只能继续用于消费,不能提现,所以按你真正要用的量分批充,别一次充一年。等队列真的排满了再转月租也不迟。

先租一周 L40S,把工作流跑通再说。

₮189 / 7 天,48GB 显存,预装 ComfyUI 镜像,四个美国机房都有货。邮箱注册,USDT 充值,约 3 分钟拿到 SSH;不合适 1 小时内可无理由退款到余额。

本页最后更新: · 价格与库存以 GPU 租用价格 页为准

Telegram
Telegram 客服@gpuli_cn7×24 小时在线
工单