先把显存账算清楚
显存占用由三块构成,绝大多数「租了卡跑不起来」的工单都只算了第一块。
权重是参数量乘以每参字节数,固定不变:BF16 为 2 字节,FP8 为 1 字节,INT4(AWQ、GPTQ)算上分组量化的 scale 后实测约 0.55–0.6 字节。KV cache 随并发与上下文长度线性增长,最容易被低估,下一节单独算。框架与激活开销含 CUDA graph、NCCL 缓冲与临时激活,单卡 1.5–3 GB,张量并行每卡再多留 1 GB。
| 模型规模 | 代表模型 | FP16 权重 | INT4 权重 | FP16 加载后 | INT4 加载后 |
|---|---|---|---|---|---|
| 7B – 8B | Llama-3.1-8B、Qwen2.5-7B、Mistral-7B | 14 – 16 GB | 4.5 – 5 GB | 约 17 GB | 约 6.5 GB |
| 13B – 14B | Qwen2.5-14B、Llama-2-13B | 28 GB | 8.5 GB | 约 30 GB | 约 11 GB |
| 32B – 34B | Qwen2.5-32B、DeepSeek-R1-Distill-32B | 64 GB | 19 GB | 约 68 GB | 约 22 GB |
| 70B – 72B | Llama-3.3-70B、Qwen2.5-72B | 140 – 145 GB | 39 – 42 GB | 约 148 GB | 约 44 GB |
| 671B MoE | DeepSeek-V3 / R1(每 token 激活 37B) | 1,342 GB | 约 380 GB | FP8 约 690 GB | 约 400 GB |
模型规模、推荐卡型与月租对照
月租为 30 天单卡价格,已含 vCPU、内存、系统盘、25 Gbps 不限量出口与公网 IPv4;多卡按 2 卡 ×1.98、4 卡 ×3.92、8 卡 ×7.6 计价。
| 要跑的模型 | 精度 | 最低显存 | 推荐卡型 | 互联 | 月租 | 折合每小时 |
|---|---|---|---|---|---|---|
| 7B / 8B Qwen2.5-7B、Llama-3.1-8B | INT4 | 12 GB | RTX A5000 24GB 或 L4 24GB ₮239、RTX 3090 ₮249 | 单卡 | ₮219 | ₮0.30 |
| 7B / 8B 全精度在线服务 | FP16 | 24 GB | RTX 4090 24GB 小模型推理主力 | 单卡 | ₮369 | ₮0.51 |
| 14B Qwen2.5-14B | INT4 | 24 GB | RTX 5090 32GB 或 RTX 4090,上下文要压短 | 单卡 | ₮499 | ₮0.69 |
| 14B 长上下文、中等并发 | FP16 | 48 GB | L40S 48GB 或 RTX A6000 ₮389、A40 ₮319 | 单卡 | ₮649 | ₮0.90 |
| 32B R1-Distill-32B、Qwen2.5-32B | INT4 | 32 GB | RTX 5090 32GB 并发要大换 L40S 48GB | 单卡 | ₮499 | ₮0.69 |
| 32B 不接受量化损失 | FP16 | 80 GB | A100 PCIe 80GB 吞吐优先选 A100 SXM ₮1,099 | 单卡 | ₮899 | ₮1.25 |
| 70B / 72B Llama-3.3-70B AWQ | INT4 | 64 GB | H100 SXM 80GB 预算紧可用 A100 80GB ₮1,099 | 单卡 | ₮1,899 | ₮2.64 |
| 70B / 72B 单卡装下不量化的权重 | FP16 | 192 GB | AMD MI300X 192GB 单卡显存最大,ROCm 版 vLLM | 单卡 | ₮1,699 | ₮2.36 |
| 70B / 72B 稳妥的双卡方案 | FP16 | 160 GB | 2 × A100 SXM 80GB NVLink 全互联,TP=2 | NVLink | ₮2,176 | ₮3.02 |
| 70B / 72B 高并发在线服务 | FP16 | 160 GB | 2 × H100 SXM 80GB 再大上 2 × H200 共 282 GB,₮5,146 | NVLink 全互联 | ₮3,760 | ₮5.22 |
| 671B MoE DeepSeek-V3 / R1 满血版 | FP8 | 1,000 GB+ | 8 × H200 141GB 合计 1,128 GB,整机 NVLink | NVLink 全互联 | ₮19,752 | ₮27.43 |
「最低显存」是能加载模型并留出可用 KV cache 的下限,不是高并发的推荐值——要更大并发,加一档显存比换更强的算力划算。周租约为月租的三成,到期前转月租、已付费用按剩余天数折抵,逐卡平衡点见 成本计算指南。
KV cache 决定你能扛多少并发
权重装进去只是能跑起来;能同时服务多少人,看的是权重之外还剩多少显存。
vLLM 把权重之外的显存几乎全部拿去做 KV cache 池(上限由 --gpu-memory-utilization 控制),池子多大就能同时装下多少 token。单 token 的 KV 只跟模型结构有关,可直接算:
| 模型 | 层数 | KV head | head_dim | 每 token(FP16) | 单请求 8K 上下文 |
|---|---|---|---|---|---|
| Llama-3.1-8B | 32 | 8 | 128 | 128 KB | 1.0 GB |
| Qwen2.5-14B | 48 | 8 | 128 | 192 KB | 1.5 GB |
| Qwen2.5-32B | 64 | 8 | 128 | 256 KB | 2.0 GB |
| Llama-3.3-70B | 80 | 8 | 128 | 320 KB | 2.5 GB |
这四个模型都用了 GQA,KV head 只有 8 个。不带 GQA 的老模型每 token 的 KV 大 4–5 倍,同样的卡能扛的并发掉到五分之一,选型优先挑带 GQA 的版本。
按卡算一遍:剩多少显存,能扛多少路
| 模型 + 卡型 | 卡显存 | 权重 + 开销 | 可用 KV | token 池 | 并发(每请求 4K) | 月租 |
|---|---|---|---|---|---|---|
| Llama-3.1-8B FP16 RTX 4090 24GB | 24 GB | 17.5 GB | 6.5 GB | 约 5.3 万 | 约 13 路 | ₮369 |
| Qwen2.5-14B FP16 L40S 48GB | 48 GB | 30 GB | 18 GB | 约 9.8 万 | 约 24 路 | ₮649 |
| Qwen2.5-32B FP16 A100 PCIe 80GB | 80 GB | 68 GB | 12 GB | 约 4.9 万 | 约 12 路 | ₮899 |
| Llama-3.3-70B INT4 H100 SXM 80GB | 80 GB | 44 GB | 36 GB | 约 11.8 万 | 约 29 路 | ₮1,899 |
| Llama-3.3-70B FP16 MI300X 192GB 单卡 | 192 GB | 148 GB | 44 GB | 约 14.4 万 | 约 35 路 | ₮1,699 |
| Llama-3.3-70B FP16 2 × H100 SXM 共 160GB | 160 GB | 150 GB | 10 GB | 约 3.3 万 | 约 8 路 | ₮3,760 |
--kv-cache-dtype fp8 把 KV 压成 8 位,token 池差不多翻倍,长上下文下损失可察觉但通常能接受;--max-model-len 从默认 128K 压到实际要的 8K 或 16K,几乎总是该做;请求共享长 system prompt 时开 --enable-prefix-caching。vLLM 部署:从开机到对外提供 API
镜像里已装好 vLLM 0.6、PyTorch 2.5 与 CUDA 12.4,下单约 3 分钟拿到 SSH,开机就能起服务,不必折腾驱动版本。
# 确认拿到的卡与显存(L40S 48GB 显示 46068 MiB) $ nvidia-smi --query-gpu=name,memory.total --format=csv NVIDIA L40S, 46068 MiB # 拉权重:25 Gbps 出口不限量,开 hf_transfer 更快 $ export HF_HUB_ENABLE_HF_TRANSFER=1 $ huggingface-cli download Qwen/Qwen2.5-14B-Instruct --local-dir /data/qwen14b # 单卡起服务:14B FP16、8K 上下文,留 8% 显存给系统与激活 $ vllm serve /data/qwen14b \ --host 0.0.0.0 --port 8000 \ --dtype bfloat16 \ --max-model-len 8192 \ --gpu-memory-utilization 0.92 \ --served-model-name qwen14b # 双卡张量并行:70B FP16 跑在 2 × A100 SXM(NVLink 全互联) $ vllm serve /data/llama70b --tensor-parallel-size 2 \ --max-model-len 16384 --gpu-memory-utilization 0.90 # KV cache 压到 FP8,token 池差不多翻倍 $ vllm serve /data/llama70b --tensor-parallel-size 2 --kv-cache-dtype fp8 # 实例自带美国公网 IPv4,除 SSH 外端口 1:1 直通,8000 直接对外 $ curl http://203.0.113.48:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"model":"qwen14b","messages":[{"role":"user","content":"你好"}]}'
- 端口与常驻。SSH 分配在 22000–22999,其余端口 1:1 直通,vLLM 默认的 8000 可直接对公网服务。跑正式服务请用 systemd 守住进程,别留在 SSH 前台,并走自己的域名与反代、至少加一层 API key;https://<实例ID>.jup.gpuli.com 上的 Jupyter 只用来调试。
- 权重放哪。H100 带 1 TB、H200 与 MI300X 带 2 TB NVMe 系统盘,L40S 与 RTX 4090 一档是 500 GB。放不下就加存储卷,₮0.08 / GB / 月;多个实例复用同一份权重时放对象存储 s3.dfw1.gpuli.com 更划算,₮0.015 / GB / 月,内网拉取不计流量。
- MI300X 的坑。ROCm 版 vLLM 对 LLaMA、Qwen、Mistral 这类稠密模型支持良好,但少数依赖自定义 CUDA kernel 的新方法没有 ROCm 实现,上生产前先用周租 ₮489 验一周。
什么时候该上多卡,以及互联的坑
推理场景下多卡不总是比大显存单卡好,加卡前先想清楚缺的是什么。
单卡装不下才必须上多卡
70B FP16 的 145 GB 权重,H100 80GB 与 H200 141GB 单卡都装不下,要么张量并行到两张,要么换显存更大的 MI300X 192GB(₮1,699)或 B200 180GB(₮3,899)。32B 及以下量化后塞得进单卡。
NVLink 与 PCIe 的差距在 decode 阶段
张量并行下每生成一个 token,每层都要做一次 all-reduce。H100 SXM、H200、B200、A100 SXM、MI300X 是节点内全互联;L40S、RTX 4090 / 5090 / 3090 只能走 PCIe 交换,双卡尚可,TP=4 以上通信开销会吃掉收益。专业 PCIe 卡双卡可 NVLink 桥接,消费卡不行。
多副本常比张量并行划算
模型单卡装得下时,两张 RTX 4090 各跑一个副本、前面挂 nginx 轮询,吞吐几乎线性翻倍且没有通信开销;TP=2 则只压低单请求延迟。总吞吐优先多副本,速度优先才上张量并行。
为什么常驻推理服务该按月租
训练跑完就能关机,推理服务不行——它得一直在,这决定了计费方式。
- 推理服务本来就是 7×24 的。按小时计费胜在「不用时关掉」,可 API 后端关不掉。真按 720 小时连续跑,单价劣势会被完整放大——RTX 4090 的平衡点是 12.8 天,H100 SXM 是 19.8 天,逐卡数字见 包月还是按小时。
- 冷启动是实打实的成本。70B INT4 的 44 GB 权重从 NVMe 加载、加上 CUDA graph 编译,vLLM 启动到就绪要 3–8 分钟;权重要重新拉则 20 分钟起。这段时间照样计费,每次重启都是一次中断;包月期内不必重启,公网 IPv4 固定,客户端不用改 endpoint。
但这四件事我们做不到
没有按秒计费,不能缩容到 0
最短周期是 7 天。服务夜里没人用的话,包月等于为每天 8 小时空转付钱,整整三分之一的租金打水漂。峰谷明显的业务,按秒计费的平台更合适。
没有自动扩缩容与 serverless 端点
我们只交付裸的 GPU 实例,不提供托管模型服务、Serverless 端点或托管 Kubernetes,多副本的负载均衡、健康检查、灰度都得自己搭。
机房全在美国,首包多等 150 ms
从中国大陆访问往返 140–190 ms(LAS-1 最低约 142 ms),这会原样加在首 token 上;流式输出开始后每个 token 的间隔不受影响。详见 延迟与线路。
只收加密货币,余额不可提现
只收 USDT、USDC、BTC、ETH、XMR 等,不收信用卡、支付宝与任何法币,开不出发票。充值进来的余额只能消费、不能提现,只有推广返佣可提,详见 加密货币付款说明。
租显卡跑大模型常见问题
跑一个 7B 模型最低要什么配置?月租多少?
70B 到底要几张卡?单张 H100 够吗?
INT4 量化会不会明显掉质量?什么时候不该量化?
推理服务要 7×24 跑,中途会被停机或抢占吗?
能用 Ollama 吗?还是必须用 vLLM?
先租一周,把你的模型真跑一遍。
RTX 4090 周租 ₮109、L40S ₮189、A100 SXM ₮319、H100 SXM ₮549。邮箱注册,USDT 充值,约 3 分钟拿到 SSH;实例创建后 1 小时内不合适,可无理由退款到余额。
本页最后更新: · 价格与库存以 GPU 租用价格 页为准