按任务选卡速查表
显存峰值为 fp16 精度、ComfyUI 默认参数下的实测区间,含 VAE 解码那一瞬间的尖峰。爆不爆显存看的是峰值,不是权重体积。
| 任务 | 显存峰值 | 推荐卡型 | 月租 | 周租 | 说明 |
|---|---|---|---|---|---|
| SD 1.5 / 2.1 出图 512–768 px | 4–6 GB | RTX A5000 24GB | ₮219 | ₮65 | 最便宜的入门档,跑老模型和插件生态完全够 |
| SDXL 出图 + Refiner 1024 px · batch 1 | 9–11 GB | RTX 4090 24GB主力 | ₮369 | ₮109 | 性价比最高的一档,四个机房都有货 |
| SDXL 批量 / 高清修复 batch 8 或放大到 2048 | 16–20 GB | RTX 4090 24GB | ₮369 | ₮109 | 24GB 刚好接得住;再叠 ControlNet 就该换 32GB |
| FLUX.1 schnell 出图 4 步 · fp8 或 fp16 | 14–24 GB | RTX 4090 24GB | ₮369 | ₮109 | 步数少,24GB 够用,出一张图 4 秒出头 |
| FLUX.1 dev FP16 常驻 1024 px · 20 步 | 33–34 GB | RTX 5090 32GB推荐 | ₮499 | ₮149 | 24GB 卡要反复换入换出权重,32GB 换入次数骤减 |
| SDXL LoRA 训练 rank 32 · batch 2 · 梯度检查点 | 18–20 GB | RTX 4090 24GB | ₮369 | ₮109 | 最常见的炼丹场景,一次训练不到一小时 |
| FLUX LoRA 训练 rank 16 · 8-bit Adam | 26–28 GB | RTX 5090 32GB | ₮499 | ₮149 | 24GB 必须换量化底模,且随时可能 OOM |
| 多模型常驻的出图服务 FLUX + SDXL + ControlNet | 38–46 GB | NVIDIA L40S 48GB | ₮649 | ₮189 | 切模型不用重新读盘,ECC 显存,为 7×24 设计 |
| SDXL 全参微调 优化器状态占大头 | 45–60 GB | A100 PCIe 80GB | ₮899 | ₮269 | 这一步已经不算出图,属于训练任务 |
出图速度与每千张成本
SDXL 口径:1024×1024、30 步、DPM++ 2M Karras、batch 1、fp16。FLUX.1 dev 口径:1024×1024、20 步、fp16。数据为我们在 DFW-1 机房实测的中位值,换采样器、开 ControlNet、换社区模型都会有出入,只作横向比较用。
| 卡型 | 显存 | 月租 | SDXL 单张 | FLUX.1 dev 单张 | SDXL 满负荷 24 小时 | SDXL 每千张 | FLUX 每千张 |
|---|---|---|---|---|---|---|---|
| RTX A5000 Ampere · PCIe4 | 24 GB | ₮219 | 11.0 s | 48 s | 7,850 张 | ₮0.93 | ₮4.06 |
| RTX 3090 Ampere · PCIe4 | 24 GB | ₮249 | 7.5 s | 34 s | 11,520 张 | ₮0.72 | ₮3.27 |
| RTX 4090性价比 Ada · PCIe4 | 24 GB | ₮369 | 4.2 s | 21 s | 20,570 张 | ₮0.60 | ₮2.99 |
| RTX 5090新品 Blackwell · PCIe5 | 32 GB | ₮499 | 2.6 s | 12 s | 33,230 张 | ₮0.50 | ₮2.31 |
| RTX A6000 Ampere · PCIe4 | 48 GB | ₮389 | 7.9 s | 26 s | 10,940 张 | ₮1.19 | ₮3.90 |
| NVIDIA L40S Ada · PCIe4 | 48 GB | ₮649 | 5.1 s | 17 s | 16,940 张 | ₮1.28 | ₮4.26 |
| RTX 6000 Ada Ada · PCIe4 | 48 GB | ₮579 | 4.3 s | 15 s | 20,090 张 | ₮0.96 | ₮3.35 |
| NVIDIA H100 PCIe Hopper · PCIe5 | 80 GB | ₮1,549 | 2.3 s | 8.5 s | 37,560 张 | ₮1.37 | ₮5.08 |
- 纯出图不要租 H100。它速度最快,但每千张 SDXL 成本是 4090 的 2.3 倍。扩散模型卡在显存带宽和 UNet 的串行步数上,不是训练卡那种大规模并行算力。同样预算租四张 4090,日产能是一张 H100 的 2.2 倍。
- 5090 的单张成本其实最低。₮0.50 / 千张比 4090 便宜 17%,因为它快得比贵得多。但它只在 DFW-1 与 ORD-1 有货且库存偏紧,RTX 4090 四个机房随开随有。产能压力不大时,4090 仍是更省心的默认选择。
- 48GB 那三张卡不是买速度。A6000、L40S、6000 Ada 的每千张成本都高于 4090,它们值钱的是显存容量与 ECC,能让 FLUX 整套常驻、切工作流不重新读盘。给客户跑长期服务选它们,自己出图不必。
- 表里是满负荷值。真实使用中调提示词、切模型、人工挑图会吃掉大量时间,实际产能通常只有表值的 20%–50%,除非你靠脚本无人值守跑。
FLUX 的显存账,为什么 24GB 会卡
FLUX.1 dev 是目前最容易把人逼到换卡的模型。把它拆成几块看,就知道 24GB、32GB、48GB 各自意味着什么。
RTX 4090 / 3090 / A5000
靠顺序加载硬撑。FLUX.1 dev 主干 fp16 就要 23.8 GB,加上 T5-XXL 编码器 9.8 GB、CLIP-L 与 VAE,全套常驻需要 33–34 GB。
- 能跑,但要换入换出。先算文本编码再卸载,然后加载主干,每张图多一次 PCIe 传输
- 换 fp8 主干可压到 11.9 GB,速度回来了,细节和文字渲染略有损失
- SDXL 完全没问题,峰值 9–11 GB,24GB 还能同时挂 ControlNet
- 月租 ₮369(4090)· 每千张 SDXL ₮0.60
RTX 5090
主干 fp16 可以常驻,只有文本编码器需要短暂让位,换 fp8 版 T5(4.9 GB)后整套塞得下。换入换出次数骤减,这是 1.7 倍速度差的来源。
- FLUX.1 dev 21 s → 12 s,同样是全精度主干
- FLUX LoRA 训练峰值 26–28 GB,这一档是最低门槛
- SDXL 高分辨率放到 2048 加 ControlNet 也不紧张
- 月租 ₮499,仅 DFW-1 与 ORD-1 有货,库存偏紧
L40S / A6000 / RTX 6000 Ada
FLUX.1 dev 加 T5-XXL 全套 fp16 常驻后还剩十几 GB,够再挂三四个 LoRA、一个 ControlNet 和一份 SDXL,服务端不必为显存写调度逻辑。
- 多模型常驻,请求打过来直接算,省掉每次几秒的读盘
- ECC 显存与企业级散热,连续跑一个月不用担心
- 单张速度不如 4090,L40S 的 SDXL 是 5.1 s 对 4.2 s,这点要认
- 月租 ₮649(L40S)· ₮389(A6000)· ₮579(6000 Ada)
ComfyUI 镜像与模型库怎么放
开机就能用的是镜像,值钱的是模型库。把这两件事分开处理,换卡和重开实例就不再是灾难。
镜像负责开机,存储卷负责积累
下单时在镜像列表里选 ComfyUI 或 Automatic1111,驱动、CUDA 12.4、PyTorch 2.5、xformers 与常用节点都装好,3 分钟内交付;想从头搭就选 Ubuntu 22.04 裸机,驱动同样现成。镜像里的 ComfyUI 只监听 127.0.0.1:8188,公网扫不到,靠 SSH 本地端口转发打开界面——建实例、装自定义节点、几个人共用一台的完整步骤在 ComfyUI 云端部署 那页,本页只谈模型库。
模型别放系统盘,也别用软链接覆盖 models 目录——镜像升级时容易被整个盖掉。ComfyUI 原生支持 extra_model_paths.yaml,把 base_path 指到存储卷的挂载点,checkpoints、loras、unet、vae 一次配好;换卡、换实例只要重新挂上同一块卷。
# 存储卷挂到 /data,模型只下一次,换实例重新挂上即可 mkdir -p /data/models/{checkpoints,loras,vae,clip,unet,controlnet} # 拉 FLUX.1 dev 主干 23.8 GB,25 Gbps 出口实测约 3 分钟 huggingface-cli download black-forest-labs/FLUX.1-dev \ flux1-dev.safetensors --local-dir /data/models/unet # 多卡机一卡一进程,端口错开,前面自己挂队列分发 for i in 0 1 2 3; do CUDA_VISIBLE_DEVICES=$i python main.py --listen 127.0.0.1 \ --port $((8188+i)) --output-directory /data/output/gpu$i & done # 成品图归档到对象存储 ₮0.015/GB/月,出口不收流量费 aws --endpoint-url https://s3.dfw1.gpuli.com \ s3 sync /data/output/ s3://my-renders/2026-09/
模型库的体积与花费
| 文件 | 体积 | 说明 |
|---|---|---|
| FLUX.1 dev 主干 fp16 | 23.8 GB | fp8 版本约 11.9 GB,schnell 体积相同 |
| T5-XXL 文本编码器 fp16 | 9.8 GB | FLUX 与部分 SD3 工作流共用,fp8 版约 4.9 GB |
| SDXL base + refiner | 13.0 GB | 6.9 GB + 6.1 GB |
| 社区微调 checkpoint | 2–7 GB / 个 | 收集癖发作的话,几十个就上百 GB |
| ControlNet 模型 | 1.4–2.5 GB / 个 | depth、canny、openpose 一般都要备齐 |
| LoRA | 20–400 MB / 个 | 数量多但不占地方 |
| 一个用了半年的模型库 | 300–800 GB | 这就是为什么不能放系统盘 |
- 系统盘装不下。4090 与 5090 实例的系统盘是 500 GB NVMe,3090 与 A5000 只有 250 GB,模型库过百 GB 后会被权重、缓存和输出一起挤满。加一块持久化存储卷挂在
/data:₮0.08 / GB / 月,500 GB 是 ₮40,1 TB 是 ₮80,相对 ₮369 的卡钱不算什么。 - 存储卷比实例活得久。卷是独立资源,实例到期、退租、换卡都不影响它,下个月从 4090 换到 5090,挂上同一块卷模型全在。第一次下载也不慢:25 Gbps 出口不限流量、不收流量费,拉 23.8 GB 的 FLUX.1 dev 实测 3 分钟左右。
- 出图产物用对象存储归档。₮0.015 / GB / 月,1 TB 成品图一个月 ₮15,标准 S3 协议,rclone 与 boto3 直接可用。日产两万张时磁盘涨得很快,定期 sync 出去比扩容存储卷便宜五倍多。
炼丹:LoRA、DreamBooth 与全参微调
群里说的「炼丹」九成是练 LoRA。它其实是这几件事里最便宜的一件,贵的是后面两件。
| 训练类型 | 典型设置 | 显存峰值 | 推荐卡 | 单次耗时 | 机时成本 |
|---|---|---|---|---|---|
| SD 1.5 LoRA | 30 张图 · rank 16 · 1,500 步 | 8–10 GB | RTX A5000 ₮219 / 月 | 约 26 分钟 | ₮0.13 |
| SDXL LoRA 最常见 | 30 张图 · 1024 px · rank 32 · batch 2 · 1,500 步 | 18–20 GB | RTX 4090 ₮369 / 月 | 约 55 分钟 | ₮0.47 |
| SDXL LoRA(快) | 同上,batch 4 | 24–27 GB | RTX 5090 ₮499 / 月 | 约 33 分钟 | ₮0.38 |
| FLUX LoRA | rank 16 · 1024 px · 8-bit Adam · 梯度检查点 · 2,000 步 | 26–28 GB | RTX 5090 ₮499 / 月 | 约 3.5 小时 | ₮2.43 |
| SDXL DreamBooth 全量 | fp16 权重 + Adam 优化器状态 | 45–60 GB | A100 PCIe 80GB ₮899 / 月 | 6–14 小时 | ₮7.5–17.5 |
机时成本 = 月租 ÷ 720 小时 × 实际耗时,不含数据准备与调参的时间。耗时按单卡、无干扰、数据已放在本地 NVMe 上测得。
- 炼丹不要按次算账。一次 SDXL LoRA 的机时成本不到半个 U,真正的开销是租期本身:RTX 4090 周租 ₮109、月租 ₮369,你付的是这段时间的独占,跑 1 次和跑 30 次一个价。
- 数据准备别在 GPU 实例上做。打标、裁切、清洗是 CPU 活,占着一张 4090 干这个是浪费。先在本地整理好数据集,用 rsync 推到实例的存储卷,卡只用来跑训练。
- 全参微调当训练任务看。SDXL 全量 DreamBooth 光优化器状态就要 30 GB 以上,48GB 卡常常不够。这时候该看 A100 80GB(PCIe 月租 ₮899),而不是继续在消费卡上抠梯度检查点。
- 训练完立刻做快照。每台实例含 1 份免费快照额度,跑通一版权重先打快照,调坏了随时回滚。快照与存储卷是两套东西,重要的权重两边都留一份。
对外出图服务与多卡扩容
给客户跑、接在自己产品后面、或者做批量代出图,考虑的东西和自己玩不一样:稳定性、并发、显存常驻、固定入口。
| 配置 | 显存合计 | 互联 | 月租 | SDXL 满负荷 24 小时 | 适合 |
|---|---|---|---|---|---|
| 1 × RTX 4090 | 24 GB | 单卡 | ₮369 | 20,570 张 | 个人与小工作室的默认起点 |
| 2 × RTX 4090 | 48 GB | PCIe 4.0 交换 | ₮731 | 41,140 张 | 一卡跑服务、一卡跑训练,互不干扰 |
| 2 × RTX 5090 | 64 GB | PCIe 5.0 交换 | ₮988 | 66,460 张 | FLUX 为主的高质量出图管线 |
| 4 × RTX 4090 | 96 GB | PCIe 4.0 交换 | ₮1,446 | 82,280 张 | 四进程并行,产能优先 |
| 4 × NVIDIA L40S | 192 GB | PCIe 4.0 交换 | ₮2,544 | 67,760 张 | 多模型常驻的商用出图 API |
| 8 × RTX 4090 | 192 GB | PCIe 4.0 交换 | ₮2,804 | 164,560 张 | 批量代出图,8 卡整机省 5% |
- 固定公网 IP 与端口直通。每台实例默认含 1 个美国 IPv4,除 SSH 外端口 1:1 直通,可以把域名 A 记录解析过来,前面套 Nginx 加 TLS 与鉴权。额外 IP ₮4 / 个 / 月,最多 4 个;停机与 7 天保留期内 IP 不变。
- 用 API 做自动化。开机、关机、快照、查余额都能通过
https://api.gpuli.com/v2调用,密钥形如gpuli_live_…;命令行工具gpuli用pip install gpuli-cli安装。队列空了自动打快照、余额低于阈值发告警,几十行脚本能搞定。 - SLA 与选点。每实例每月 99.9%,未达标按停机时长 3 倍补偿(低于 99% 补 10 倍,低于 95% 当月免费),硬件故障 30 分钟内迁移或更换,近 12 个月全站可用性 99.95%。4090 与 L40S 四个机房都有货,5090 只在 DFW-1 与 ORD-1;对交互延迟敏感选 LAS-1(香港 142 ms,全站最低),详见延迟与线路说明。
这几件事我们做不好
出图这个场景里,我们有几处明显的不方便。先说清楚,比你付完钱再发现好。
ComfyUI 网页拖节点会迟滞
机房全在美国,从中国大陆访问往返 140–190 ms。出图计算在服务器端完成,单张耗时不受影响;但画布交互、节点拖动、参数滑块每次操作都要走一个往返,手感不如本地。
没有按小时计费
最短一个周期是 7 天。一周只出几十张图、一个月开机两三次的话,在我们这里等于为闲置时间付钱,按秒计费的平台更合适,这一点我们不争。盈亏平衡点算在包月还是按小时,横向报价见平台对比。
只收加密货币,不开发票
USDT、USDC、BTC、ETH、XMR、LTC、SOL,不收支付宝、微信和银行卡,也开不出人民币发票。另外充值进来的余额不可提现,只有推广返佣能提,请按实际需要充值。细节见加密货币付款说明。
还有两条:实例创建后 1 小时内可无理由退款到钱包余额,所以第一小时请把出图和训练都真跑一遍;到期停机后数据保留 7 天,重要的权重和成品图记得提前同步到对象存储。
SD 云端显卡常见问题
跑 SDXL 到底要多大显存?24GB 的 RTX 4090 够吗?
FLUX.1 dev 一定要 32GB 吗?4090 能不能跑?
模型文件放哪里?每次开新实例都要重新下载吗?
租四张 4090,能一起加速同一张图吗?
炼一个 SDXL LoRA 大概要多久、多少钱?
140–190 ms 的延迟会拖慢出图速度吗?
一个邮箱,一笔 USDT,三分钟开始出图。
RTX 4090 月租 ₮369 / 周租 ₮109,ComfyUI 镜像开箱即用。不合适 1 小时内可退款到余额。
本页最后更新: · 价格与库存以 GPU 租用价格 页为准