首页/GPU 租用/跑大模型推理

RUN LLM INFERENCE · LLAMA / QWEN / DEEPSEEK

租 GPU 跑 LLaMA、Qwen 大模型推理

部署开源大模型推理,最先撞上的墙永远是显存。这页把 7B 到 671B 的显存账算清楚:模型规模到卡型的月租对照表、KV cache 与并发的估算方法、vLLM 的启动参数,以及常驻推理为什么该按月租卡。

一句话回答:先按显存挑卡:7B 用 RTX 4090 24GB(₮369/月)、14B 用 L40S 48GB(₮649)、32B 用 A100 80GB(₮899 起)、70B 量化到 INT4 后单张 H100 80GB(₮1,899)就够,不量化则要 MI300X 192GB 单卡(₮1,699)或双卡 A100。按 30 天包月,USDT 付款,注册只要邮箱。
VRAM Math

先把显存账算清楚

显存占用由三块构成,绝大多数「租了卡跑不起来」的工单都只算了第一块。

全部 16 款显存与报价 →

权重是参数量乘以每参字节数,固定不变:BF16 为 2 字节,FP8 为 1 字节,INT4(AWQ、GPTQ)算上分组量化的 scale 后实测约 0.55–0.6 字节。KV cache 随并发与上下文长度线性增长,最容易被低估,下一节单独算。框架与激活开销含 CUDA graph、NCCL 缓冲与临时激活,单卡 1.5–3 GB,张量并行每卡再多留 1 GB。

显存需求 ≈ 参数量 × 每参字节 + KV cache + 框架与激活开销(1.5–3 GB)
模型规模代表模型FP16 权重INT4 权重FP16 加载后INT4 加载后
7B – 8BLlama-3.1-8B、Qwen2.5-7B、Mistral-7B14 – 16 GB4.5 – 5 GB约 17 GB约 6.5 GB
13B – 14BQwen2.5-14B、Llama-2-13B28 GB8.5 GB约 30 GB约 11 GB
32B – 34BQwen2.5-32B、DeepSeek-R1-Distill-32B64 GB19 GB约 68 GB约 22 GB
70B – 72BLlama-3.3-70B、Qwen2.5-72B140 – 145 GB39 – 42 GB约 148 GB约 44 GB
671B MoEDeepSeek-V3 / R1(每 token 激活 37B)1,342 GB约 380 GBFP8 约 690 GB约 400 GB
MoE 是个例外:DeepSeek-V3 与 R1 总参数 671B,每 token 只激活 37B——显存按 671B 备,算力只吃 37B 的量。原生 FP8 权重约 671 GB,加开销近 700 GB,8 张 H100 SXM(合计 640 GB)装不下,得上 8 张 H200(1,128 GB,₮19,752/月)。想省钱用 32B 蒸馏版,一张 A100 80GB 足够。
Model → GPU → Price

模型规模、推荐卡型与月租对照

月租为 30 天单卡价格,已含 vCPU、内存、系统盘、25 Gbps 不限量出口与公网 IPv4;多卡按 2 卡 ×1.98、4 卡 ×3.92、8 卡 ×7.6 计价。

全部报价 →
要跑的模型精度最低显存推荐卡型互联月租折合每小时
7B / 8B
Qwen2.5-7B、Llama-3.1-8B
INT412 GBRTX A5000 24GB
或 L4 24GB ₮239、RTX 3090 ₮249
单卡₮219₮0.30
7B / 8B
全精度在线服务
FP1624 GBRTX 4090 24GB
小模型推理主力
单卡₮369₮0.51
14B
Qwen2.5-14B
INT424 GBRTX 5090 32GB
或 RTX 4090,上下文要压短
单卡₮499₮0.69
14B
长上下文、中等并发
FP1648 GBL40S 48GB
或 RTX A6000 ₮389、A40 ₮319
单卡₮649₮0.90
32B
R1-Distill-32B、Qwen2.5-32B
INT432 GBRTX 5090 32GB
并发要大换 L40S 48GB
单卡₮499₮0.69
32B
不接受量化损失
FP1680 GBA100 PCIe 80GB
吞吐优先选 A100 SXM ₮1,099
单卡₮899₮1.25
70B / 72B
Llama-3.3-70B AWQ
INT464 GBH100 SXM 80GB
预算紧可用 A100 80GB ₮1,099
单卡₮1,899₮2.64
70B / 72B
单卡装下不量化的权重
FP16192 GBAMD MI300X 192GB
单卡显存最大,ROCm 版 vLLM
单卡₮1,699₮2.36
70B / 72B
稳妥的双卡方案
FP16160 GB2 × A100 SXM 80GB
NVLink 全互联,TP=2
NVLink₮2,176₮3.02
70B / 72B
高并发在线服务
FP16160 GB2 × H100 SXM 80GB
再大上 2 × H200 共 282 GB,₮5,146
NVLink 全互联₮3,760₮5.22
671B MoE
DeepSeek-V3 / R1 满血版
FP81,000 GB+8 × H200 141GB
合计 1,128 GB,整机 NVLink
NVLink 全互联₮19,752₮27.43

「最低显存」是能加载模型并留出可用 KV cache 的下限,不是高并发的推荐值——要更大并发,加一档显存比换更强的算力划算。周租约为月租的三成,到期前转月租、已付费用按剩余天数折抵,逐卡平衡点见 成本计算指南

KV Cache & Concurrency

KV cache 决定你能扛多少并发

权重装进去只是能跑起来;能同时服务多少人,看的是权重之外还剩多少显存。

vLLM 把权重之外的显存几乎全部拿去做 KV cache 池(上限由 --gpu-memory-utilization 控制),池子多大就能同时装下多少 token。单 token 的 KV 只跟模型结构有关,可直接算:

每 token KV = 2(K 与 V)× 层数 × KV head 数 × head_dim × 精度字节数
模型层数KV headhead_dim每 token(FP16)单请求 8K 上下文
Llama-3.1-8B328128128 KB1.0 GB
Qwen2.5-14B488128192 KB1.5 GB
Qwen2.5-32B648128256 KB2.0 GB
Llama-3.3-70B808128320 KB2.5 GB

这四个模型都用了 GQA,KV head 只有 8 个。不带 GQA 的老模型每 token 的 KV 大 4–5 倍,同样的卡能扛的并发掉到五分之一,选型优先挑带 GQA 的版本。

按卡算一遍:剩多少显存,能扛多少路

模型 + 卡型卡显存权重 + 开销可用 KVtoken 池并发(每请求 4K)月租
Llama-3.1-8B FP16
RTX 4090 24GB
24 GB17.5 GB6.5 GB约 5.3 万约 13 路₮369
Qwen2.5-14B FP16
L40S 48GB
48 GB30 GB18 GB约 9.8 万约 24 路₮649
Qwen2.5-32B FP16
A100 PCIe 80GB
80 GB68 GB12 GB约 4.9 万约 12 路₮899
Llama-3.3-70B INT4
H100 SXM 80GB
80 GB44 GB36 GB约 11.8 万约 29 路₮1,899
Llama-3.3-70B FP16
MI300X 192GB 单卡
192 GB148 GB44 GB约 14.4 万约 35 路₮1,699
Llama-3.3-70B FP16
2 × H100 SXM 共 160GB
160 GB150 GB10 GB约 3.3 万约 8 路₮3,760
最后两行值得多看一眼。跑 70B FP16 时,一张 MI300X 留给 KV cache 的 44 GB,是两张 H100 剩下 10 GB 的四倍多,月租还便宜一半以上;但两张 H100 的算力与带宽高得多,单请求等待更短。缺并发选大显存单卡,缺速度选多卡 NVLink,两个都缺就上 2 × H200(282 GB,₮5,146/月)。
省显存的三个开关。--kv-cache-dtype fp8 把 KV 压成 8 位,token 池差不多翻倍,长上下文下损失可察觉但通常能接受;--max-model-len 从默认 128K 压到实际要的 8K 或 16K,几乎总是该做;请求共享长 system prompt 时开 --enable-prefix-caching
Deploy with vLLM

vLLM 部署:从开机到对外提供 API

镜像里已装好 vLLM 0.6、PyTorch 2.5 与 CUDA 12.4,下单约 3 分钟拿到 SSH,开机就能起服务,不必折腾驱动版本。

使用文档 →
# 确认拿到的卡与显存(L40S 48GB 显示 46068 MiB)
$ nvidia-smi --query-gpu=name,memory.total --format=csv
NVIDIA L40S, 46068 MiB

# 拉权重:25 Gbps 出口不限量,开 hf_transfer 更快
$ export HF_HUB_ENABLE_HF_TRANSFER=1
$ huggingface-cli download Qwen/Qwen2.5-14B-Instruct --local-dir /data/qwen14b

# 单卡起服务:14B FP16、8K 上下文,留 8% 显存给系统与激活
$ vllm serve /data/qwen14b \
    --host 0.0.0.0 --port 8000 \
    --dtype bfloat16 \
    --max-model-len 8192 \
    --gpu-memory-utilization 0.92 \
    --served-model-name qwen14b

# 双卡张量并行:70B FP16 跑在 2 × A100 SXM(NVLink 全互联)
$ vllm serve /data/llama70b --tensor-parallel-size 2 \
    --max-model-len 16384 --gpu-memory-utilization 0.90

# KV cache 压到 FP8,token 池差不多翻倍
$ vllm serve /data/llama70b --tensor-parallel-size 2 --kv-cache-dtype fp8

# 实例自带美国公网 IPv4,除 SSH 外端口 1:1 直通,8000 直接对外
$ curl http://203.0.113.48:8000/v1/chat/completions \
    -H "Content-Type: application/json" \
    -d '{"model":"qwen14b","messages":[{"role":"user","content":"你好"}]}'
  • 端口与常驻。SSH 分配在 22000–22999,其余端口 1:1 直通,vLLM 默认的 8000 可直接对公网服务。跑正式服务请用 systemd 守住进程,别留在 SSH 前台,并走自己的域名与反代、至少加一层 API key;https://<实例ID>.jup.gpuli.com 上的 Jupyter 只用来调试。
  • 权重放哪。H100 带 1 TB、H200 与 MI300X 带 2 TB NVMe 系统盘,L40S 与 RTX 4090 一档是 500 GB。放不下就加存储卷,₮0.08 / GB / 月;多个实例复用同一份权重时放对象存储 s3.dfw1.gpuli.com 更划算,₮0.015 / GB / 月,内网拉取不计流量。
  • MI300X 的坑。ROCm 版 vLLM 对 LLaMA、Qwen、Mistral 这类稠密模型支持良好,但少数依赖自定义 CUDA kernel 的新方法没有 ROCm 实现,上生产前先用周租 ₮489 验一周。
Multi-GPU

什么时候该上多卡,以及互联的坑

推理场景下多卡不总是比大显存单卡好,加卡前先想清楚缺的是什么。

多卡整机说明 →
01

单卡装不下才必须上多卡

70B FP16 的 145 GB 权重,H100 80GB 与 H200 141GB 单卡都装不下,要么张量并行到两张,要么换显存更大的 MI300X 192GB(₮1,699)或 B200 180GB(₮3,899)。32B 及以下量化后塞得进单卡。

02

NVLink 与 PCIe 的差距在 decode 阶段

张量并行下每生成一个 token,每层都要做一次 all-reduce。H100 SXM、H200、B200、A100 SXM、MI300X 是节点内全互联;L40S、RTX 4090 / 5090 / 3090 只能走 PCIe 交换,双卡尚可,TP=4 以上通信开销会吃掉收益。专业 PCIe 卡双卡可 NVLink 桥接,消费卡不行。

03

多副本常比张量并行划算

模型单卡装得下时,两张 RTX 4090 各跑一个副本、前面挂 nginx 轮询,吞吐几乎线性翻倍且没有通信开销;TP=2 则只压低单请求延迟。总吞吐优先多副本,速度优先才上张量并行。

关于 InfiniBand:推理基本用不上。8 卡以内的张量并行在节点内完成,NVLink 就够;InfiniBand 8 卡节点(₮600 / 节点 / 月)是给跨机训练准备的,只有把 DeepSeek-V3 这类超大 MoE 拆到多台机器时才需要,绝大多数推理部署不必为它付钱。
Monthly vs Hourly

为什么常驻推理服务该按月租

训练跑完就能关机,推理服务不行——它得一直在,这决定了计费方式。

与其他平台对比 →
  • 推理服务本来就是 7×24 的。按小时计费胜在「不用时关掉」,可 API 后端关不掉。真按 720 小时连续跑,单价劣势会被完整放大——RTX 4090 的平衡点是 12.8 天,H100 SXM 是 19.8 天,逐卡数字见 包月还是按小时
  • 冷启动是实打实的成本。70B INT4 的 44 GB 权重从 NVMe 加载、加上 CUDA graph 编译,vLLM 启动到就绪要 3–8 分钟;权重要重新拉则 20 分钟起。这段时间照样计费,每次重启都是一次中断;包月期内不必重启,公网 IPv4 固定,客户端不用改 endpoint。

但这四件事我们做不到

没有按秒计费,不能缩容到 0

最短周期是 7 天。服务夜里没人用的话,包月等于为每天 8 小时空转付钱,整整三分之一的租金打水漂。峰谷明显的业务,按秒计费的平台更合适。

没有自动扩缩容与 serverless 端点

我们只交付裸的 GPU 实例,不提供托管模型服务、Serverless 端点或托管 Kubernetes,多副本的负载均衡、健康检查、灰度都得自己搭。

机房全在美国,首包多等 150 ms

从中国大陆访问往返 140–190 ms(LAS-1 最低约 142 ms),这会原样加在首 token 上;流式输出开始后每个 token 的间隔不受影响。详见 延迟与线路

只收加密货币,余额不可提现

只收 USDT、USDC、BTC、ETH、XMR 等,不收信用卡、支付宝与任何法币,开不出发票。充值进来的余额只能消费、不能提现,只有推广返佣可提,详见 加密货币付款说明

FAQ

租显卡跑大模型常见问题

帮助中心 →
跑一个 7B 模型最低要什么配置?月租多少?
量化到 INT4 的 7B 权重只有 4.5–5 GB,一张 RTX A5000 24GB(₮219/月)或 L4 24GB(₮239/月)就够。要跑 FP16 全精度就选 RTX 4090 24GB,月租 ₮369、周租 ₮109:权重加开销约 17 GB,剩 6.5 GB 的 KV 池按每请求 4K token 算能扛约 13 路并发。个人自用或小团队内部工具,4090 最省心。
70B 到底要几张卡?单张 H100 够吗?
看量不量化。Llama-3.3-70B 的 FP16 权重 140–145 GB,H100 80GB 与 H200 141GB 单卡都装不下:要么两张卡张量并行(2 × A100 SXM ₮2,176/月,或 2 × H100 SXM ₮3,760/月),要么用单卡显存更大的 MI300X 192GB(₮1,699/月)或 B200 180GB(₮3,899/月)。接受 INT4 量化则权重降到 39–42 GB,单张 H100 SXM(₮1,899/月)就能跑,还剩 36 GB 做 KV cache,并发比双卡 FP16 还强,这是我们最常推荐的 70B 方案。
INT4 量化会不会明显掉质量?什么时候不该量化?
对 70B 这类大模型,AWQ / GPTQ 的 INT4 在通用对话与摘要上损失很小,越大的模型越抗量化。三种情况建议保留 FP16:长链条数学推理与代码生成,错误更容易暴露;模型本身就小(7B 以下),冗余少;输出要拿去做训练数据。稳妥做法是先用 FP16 周租跑一周基线,再拿量化版比对同一批真实请求。
推理服务要 7×24 跑,中途会被停机或抢占吗?
不会。没有竞价与 spot 档位,付费周期内整卡独占,不回收也不降频。唯一例外是硬件故障,30 分钟内迁移或更换并按 SLA 补偿:每实例每月低于 99.9% 按停机时长 3 倍补,低于 99% 补 10 倍,低于 95% 全月免费。到期未续费停机后,数据与公网 IP 保留 7 天。
能用 Ollama 吗?还是必须用 vLLM?
都可以,镜像里 vLLM 0.6 与 Ollama 都有。Ollama 一条命令拉起模型、自动处理量化格式,适合单人自用或快速验证,但并发能力有限。面向多用户的线上服务建议用 vLLM:连续批处理与 PagedAttention 让同一张卡的吞吐高出数倍——14B FP16 在一张 L40S 48GB 上能扛约 24 路,接口是 OpenAI 兼容的 /v1/chat/completions,客户端基本不用改。镜像可在控制台随时重装。

先租一周,把你的模型真跑一遍。

RTX 4090 周租 ₮109、L40S ₮189、A100 SXM ₮319、H100 SXM ₮549。邮箱注册,USDT 充值,约 3 分钟拿到 SSH;实例创建后 1 小时内不合适,可无理由退款到余额。

本页最后更新: · 价格与库存以 GPU 租用价格 页为准

Telegram
Telegram 客服@gpuli_cn7×24 小时在线
工单