主流视频扩散模型先用 3D VAE 把像素压成潜变量:空间压 8 倍、时间压 4 倍,进 DiT 之前再做一次 2×2 patch 化。真正参与注意力计算的 token 数,可以用下面这个式子直接估出来——换一组分辨率和帧数自己算一遍,就知道显存和时间会往哪个方向跑。
# latent token 数(3D VAE 空间 8 倍 + 时间 4 倍下采样,再做 2×2 patch) tokens = (宽 / 16) × (高 / 16) × ((帧数 - 1) / 4 + 1) # 例一:832×480、81 帧(约 5 秒 @16fps) tokens = 52 × 30 × 21 = 32,760 # 例二:1280×720、81 帧 —— 只是分辨率提一档 tokens = 80 × 45 × 21 = 75,600 # token 变成 2.31 倍 # 注意力的计算量与 token 数的平方成正比 → 这一段慢 5.3 倍 # 开了 FlashAttention 之后,激活显存回到线性增长,但时间省不掉
| 输出规格 | latent token | 注意力相对开销 | 14B 模型峰值显存 | 够用的卡 |
|---|---|---|---|---|
| 832×480 · 81 帧 约 5 秒 @16fps | 32,760 | 1× | 约 36–44 GB | L40S 48GB 够 |
| 832×480 · 161 帧 约 10 秒 @16fps | 63,960 | 3.8× | 约 44–54 GB | 48GB 吃紧,建议 80GB |
| 1280×720 · 81 帧 约 5 秒 @16fps | 75,600 | 5.3× | 约 46–58 GB | 48GB 吃紧,建议 80GB |
| 1280×720 · 129 帧 约 8 秒 @16fps | 118,800 | 13× | 约 58–72 GB | A100 / H100 80GB |
| 1920×1088 · 81 帧 约 5 秒 @16fps | 171,360 | 27× | 约 76–96 GB | 要 H200 141GB 或分块 |
显存为 14B 级模型 bf16 权重常驻、开启 FlashAttention、文本编码器用完即卸载的量级估算,不同框架与优化开关差别可到 ±30%。「注意力相对开销」只描述注意力那一段,整条流水线的实际耗时增长会平缓一些,但方向一致:加帧数比加分辨率便宜,分辨率两边各翻倍等于 token 变四倍、注意力变十六倍。
常见视频模型对显存的要求
先看你要跑哪个模型,权重体积基本决定了显存的下限;再看你要出什么分辨率,那决定上限。
| 模型 | 参数量 | bf16 权重 | 典型输出 | 24 GB 卡 | 48 GB 卡 | 80 GB 卡 |
|---|---|---|---|---|---|---|
| Wan 2.1 T2V-1.3B 通义万相 · 轻量档 | 1.3B | 约 2.6 GB | 480p · 5 秒 | 从容 | 从容 | 从容 |
| Wan 2.1 T2V / I2V-14B 通义万相 · 主力档 | 14B | 约 28 GB | 480p–720p · 5 秒 | 要 FP8 量化 + 分块,易 OOM | 480p 可以,720p 吃紧 | 720p 从容 |
| HunyuanVideo 腾讯混元视频 | 13B | 约 26 GB | 720p · 5 秒 | 要 FP8 量化,稳定性差 | 720p 吃紧 | 从容 |
| CogVideoX-5B 智谱 · I2V / T2V | 5B | 约 10 GB | 720×480 · 6 秒 | 要开 CPU offload | 从容 | 从容 |
| Mochi 1 Genmo · 开源权重 | 10B | 约 20 GB | 480p · 5 秒 | 吃紧 | 从容 | 从容 |
| LTX-Video 轻量 · 出预览快 | 2B | 约 4 GB | 768×512 · 快速预览 | 从容 | 从容 | 从容 |
权重体积按官方 bf16 发布版估算,社区的 FP8 与 GGUF 量化版大约能砍掉一半,代价是画质与跨批次一致性掉一点、长镜头闪烁更明显。别忘了文本编码器:Wan 用的 umT5-XXL 在 fp16 下要 11 GB 左右,若让它常驻显存而不是编码完就卸载,上面每一行都要再加这个数。
按预算与目标分辨率选卡
| 你的情况 | 推荐卡型 | 显存 | 月租 · 30 天 | 周租 · 7 天 | 折合每小时 | 可用机房 |
|---|---|---|---|---|---|---|
| 先试水,只跑 480p 小模型 | RTX 4090 Ada · PCIe4 | 24 GB | ₮369 | ₮109 | ₮0.51 | 四个机房都有 |
| 预算最紧,但要 48GB | NVIDIA A40 Ampere · PCIe4 | 48 GB | ₮319 | ₮95 | ₮0.44 | IAD-1 · LAS-1 |
| 48GB 里性价比最高 | NVIDIA RTX A6000 Ampere · PCIe4 | 48 GB | ₮389 | ₮115 | ₮0.54 | DFW-1 · IAD-1 · LAS-1 |
| 用 FP8 量化冲 720p | RTX 5090 Blackwell · 原生 FP4/FP8 | 32 GB | ₮499 | ₮149 | ₮0.69 | DFW-1 · ORD-1新品 |
| 稳定起步,最省心的一档 | NVIDIA L40S推荐 Ada · 支持 FP8 | 48 GB | ₮649 | ₮189 | ₮0.90 | 四个机房都有 |
| 720p 从容 + 训练视频 LoRA | A100 PCIe 80GB Ampere · PCIe4 | 80 GB | ₮899 | ₮269 | ₮1.25 | IAD-1 · LAS-1 |
| 接单量大,要吞吐 | H100 SXM 80GB Hopper · FP8 | 80 GB | ₮1,899 | ₮549 | ₮2.64 | DFW-1 · IAD-1 · ORD-1 |
| 1080p 一次成型不分块 | NVIDIA H200 Hopper · 141GB HBM3e | 141 GB | ₮2,599 | ₮739 | ₮3.61 | DFW-1 · ORD-1 |
一条片子要跑多久,折成多少钱
出一张图十几秒,出一条五秒片子十几到几十分钟。把这个数字换算成钱,才知道该租哪张卡。
| 卡型 | 显存 | 月租 | 折合每小时 | 单条 5 秒 720p 耗时 | 每条成本 | 30 天满负荷可出 |
|---|---|---|---|---|---|---|
| RTX 5090 FP8 量化跑 | 32 GB | ₮499 | ₮0.69 | 18–28 分 | 约 ₮0.26 | 约 1,900 条 |
| RTX A6000 bf16 · Ampere | 48 GB | ₮389 | ₮0.54 | 36–55 分 | 约 ₮0.41 | 约 950 条 |
| NVIDIA L40S推荐 bf16 / FP8 · Ada | 48 GB | ₮649 | ₮0.90 | 22–35 分 | 约 ₮0.43 | 约 1,500 条 |
| A100 PCIe 80GB bf16 · Ampere | 80 GB | ₮899 | ₮1.25 | 14–20 分 | 约 ₮0.36 | 约 2,500 条 |
| A100 SXM 80GB bf16 · NVLink | 80 GB | ₮1,099 | ₮1.53 | 13–18 分 | 约 ₮0.40 | 约 2,750 条 |
| H100 SXM 80GB FP8 · Hopper | 80 GB | ₮1,899 | ₮2.64 | 6–9 分 | 约 ₮0.33 | 约 5,700 条 |
| NVIDIA H200 FP8 · 141GB | 141 GB | ₮2,599 | ₮3.61 | 5–8 分 | 约 ₮0.39 | 约 6,600 条 |
耗时为 14B 级模型、50 步采样、不开蒸馏与步数压缩、单条串行生成的量级参考。换 4 步蒸馏模型可以快五到八倍,换 1.3B 小模型可以快十倍以上,所以这张表用来横向比较卡型,别拿去做交付承诺。「每条成本」= 月租 ÷ 满负荷条数,前提是这张卡 30 天不停在出片。
量大了怎么办:多卡是并行队列,不是并行一条片子
先泼一盆冷水:把一条视频拆到多张卡上并行生成,在大多数现成工作流里做不到。ComfyUI、Diffusers 的默认路径都是单卡跑完一条,除非你上 xDiT / USP 这类序列并行方案,而它们要求卡间有 NVLink 才划算。
所以做批量生产的人,多卡的用法是「一卡一条队列」:四张卡同时跑四个任务,吞吐乘四、单条速度不变。这种用法对互联没有要求,L40S、RTX 4090 这些走 PCIe 交换、没有 NVLink 的卡完全够用,还更便宜。真正需要 NVLink 全互联的是 A100 SXM 与 H100 SXM,用在视频模型的微调上——训练要存优化器状态与梯度,比推理更吃显存,14B 的 LoRA 训练建议从 80GB 单卡起步,全参微调得上 8 卡节点,必要时加 InfiniBand 8 卡节点(₮600 / 节点 / 月)。
| 多卡配置 | 月租 | 互联与用法 |
|---|---|---|
| 2 × RTX 4090 | ₮731 | PCIe 交换,无 NVLink · 两条 480p 队列 |
| 4 × RTX 4090 | ₮1,446 | 480p 批量出片最便宜的组合 |
| 2 × L40S | ₮1,285 | PCIe 交换 · 约 3,000 条 / 月 |
| 4 × L40S | ₮2,544 | 约 6,000 条 / 月,工作室常用 |
| 8 × L40S | ₮4,932 | 8 卡整机省 5% |
| 4 × A100 PCIe 80GB | ₮3,524 | 双卡可 NVLink 桥接 · 720p 队列 |
| 8 × H100 SXM | ₮14,432 | NVLink 全互联 · 视频模型微调 |
多卡倍率:2 卡 ×1.98、4 卡 ×3.92、8 卡 ×7.6。多卡为同一台物理机内的卡,不是拼凑的多台实例。
视频这种长任务,为什么按月包卡更合算
出图任务可以「用完就关」,视频任务往往关不掉。下面五条是我们工单里最常听到的迁移理由。
- 单次任务不能中断。一条 8 秒 720p 在 L40S 上要跑将近一小时。用可抢占档位跑到第 50 分钟被顶掉,钱照付、片子没有。我们没有竞价机制也没有 spot 档位,付费周期内整卡独占,除硬件故障外不回收、不降频、不迁移。
- 模型权重太大,冷启动本身就在烧钱。Wan 14B 一整套(DiT + umT5-XXL + VAE)落盘 60–80 GB,HunyuanVideo 相当。按小时开关机,每次重新拉权重要二三十分钟,卡在转、钱在扣;一个月开关十几次,光冷启动就吃掉几个小时机时。包月的机器权重一直躺在 NVMe 上,重启即用。
- 视频生产是队列式的。真实节奏是白天调 prompt 和参考图、晚上挂一整夜批量渲染、第二天挑片重跑。卡基本闲不下来,「用完就关」在这里不成立。
- 失败重试的成本极高。OOM、采样出 NaN、VAE 解码爆显存、种子不理想——视频的重跑率比出图高得多,一次重试就是几十分钟。按小时计费时每次失败都写进账单;包月只消耗时间,不额外产生费用。
- 按条报价的生意需要固定成本。月租在下单时从余额一次性扣除、周期内价格锁死,不随时段和供需浮动,你可以直接把 ₮649 ÷ 当月出片数量写进报价单。
素材、权重和成片分别放在哪
视频的存储压力比出图大一个量级:一条 5 秒 720p 的无损帧序列就能到几个 GB。放错地方,要么塞爆系统盘,要么到期一起没了。
放系统盘
L40S、5090、A6000 自带 500 GB NVMe,A100 80GB 与 H100 是 1 TB。Wan 14B 全套 60–80 GB,500 GB 大概装三套主力模型。权重是随机小块读,必须放本地 NVMe,别放对象存储再挂载。
放持久化存储卷
₮0.08 / GB / 月,1 TB 是 ₮80。适合反复随机读的视频 LoRA 训练集、帧序列与标注文件。存储卷独立于实例生命周期,换卡、重装镜像都不影响里面的数据。
放对象存储
₮0.015 / GB / 月,1 TB 只要 ₮15,比存储卷便宜五倍多。走标准 S3 协议,端点 s3.dfw1.gpuli.com,实例内用 s3-internal 走内网更快。出口不限流量,客户取片不额外收钱。
# 出片自动同步:跑在 tmux 里,每 5 分钟把 ComfyUI 的 output 推到对象存储 export EP=https://s3.dfw1.gpuli.com while true; do aws --endpoint-url $EP s3 sync \ /workspace/ComfyUI/output/ s3://video-out/2026-09/ --only-show-errors sleep 300 done # 拉参考素材:实例内务必用内网端点,比公网快且不占出口带宽 aws --endpoint-url https://s3-internal.dfw1.gpuli.com \ s3 sync s3://assets/ref-clips/ /workspace/ref/ # 换机 / 续费前,确认两边条数一致再释放旧实例 ls /workspace/ComfyUI/output/*.mp4 | wc -l aws --endpoint-url $EP s3 ls s3://video-out/2026-09/ | wc -l
预装镜像可直接选 ComfyUI(含 ComfyUI-Manager,端口 8188,不含模型权重)或 PyTorch 2.5 + CUDA 12.4 自己搭。aws-cli、rclone、boto3 都能读写对象存储,桶与访问密钥在控制台创建。Jupyter 在 https://实例ID.jup.gpuli.com,SSH 端口 22000–22999。
租之前该知道的几件不那么好听的事
视频生成这个场景里我们有几个具体短板,写在前面比事后解释强。
ComfyUI 的网页操作会有迟滞
四个机房全在美国本土,从中国大陆访问的往返延迟 140–190 ms,LAS-1 拉斯维加斯最低(约 142 ms)。跑任务完全不受影响,但在浏览器里拖节点、连线、拉滑块有肉眼可感的粘手感。稳妥做法是本地编好工作流 JSON 传上去跑批,或用 API 模式提交队列。
成片要下载才能看
25 Gbps 共享出口不限流量,拉一条几十 MB 的成片是几秒钟的事;但想在网页里逐帧刮擦 1080p,体验会很差。建议同时输出低码率预览版,拉回本地挑片,选定后再下成片。
最短一个周期是 7 天,没有按小时
关机、出差、这周没接到单,租金照扣。视频生成偏偏是个「有单就爆满、没单就闲置」的行当,接单节奏断续的话请认真算一下闲置成本,或者干脆用按秒计费的平台。这是我们做不到的事。
只收加密货币,开不出发票,余额不可提现
只接受 USDT、USDC、BTC、ETH、XMR 等,不收支付宝、微信与银行卡,也开不出增值税发票——控制台能导出含链上哈希的充值与消费明细,但那不是税务意义上的发票。充值进来的余额只能继续用于消费,不能提现,只有推广返佣可以每周提现为 USDT、最低 ₮50,所以请按实际用量分批充值。另外 Windows Server 2022 镜像(₮25 / 月)只提供给 PCIe 卡型,SXM 卡型没有 Windows。
付款细节见加密货币付款说明,注册与身份要求见无需实名说明——注册只要一个邮箱,Proton、Tuta 这类匿名邮箱也接受。
AI 视频生成租卡常见问题
24GB 的 RTX 4090 到底能不能跑视频生成?
Wan 万相 14B 和混元视频需要多大显存?
生成一条 5 秒视频要多久、要花多少钱?
多卡能让单条视频生成得更快吗?
素材和成片放在哪?实例到期数据会不会丢?
我接单是断续的,一个月只做十几条片子,还适合包月吗?
本页最后更新: · 价格与库存以 GPU 租用价格 页为准