Solutions · By Workload
解决方案
按场景整理的推荐配置、预装镜像与用户案例:哪张显卡够用、租一周还是包月、一个月要花多少。价格取自 2026-09-01 的月租报价,多卡均为同节点 NVLink 整机,2 卡 1% 折扣、4 卡 2%、8 卡 5%。案例来自工单与 Telegram 群,经本人同意后匿名整理。
大模型训练与微调
从 7B 的 LoRA 到 70B 的全参微调,再到小模型的继续预训练。
训练任务的共同点是:跑得久、不能断、显存越大越省事。我们的 8 卡 HGX 整机为同一节点内 NVLink 全互联(H100 / H200 为 900 GB/s,B200 为 1.8 TB/s),配双路 96 核 CPU、2 TB 内存与 8 × 3.84 TB 本地 NVMe,可选 400G InfiniBand 多机组网(₮600/节点/月,DFW-1 与 ORD-1)。按月租用,中途不会因为别人出价更高而被抢占;checkpoint 直接写本地 NVMe,不用每半小时往对象存储同步一次。裸金属模式免费,装自己的驱动与容器运行时都行。
| 配置 | 显存合计 | 适合 | 机房 | 月租 | |
|---|---|---|---|---|---|
| 8 × H100 SXM 80GB HGX · NVLink 全互联 · 可选 IB | 640 GB | 7B–70B 全参微调、批量 LoRA、小模型预训练 | DFW-1 / IAD-1 / ORD-1 | ₮14,432 | 部署 |
| 8 × H200 141GB HGX · NVLink 全互联 · 可选 IB | 1,128 GB | 70B 以上全参、长上下文、MoE、DPO / GRPO | DFW-1 / ORD-1 | ₮19,752 | 部署 |
| 4 × A100 SXM 80GB NVLink 全互联 · 预算优先 | 320 GB | 7B–13B 全参、大批量 LoRA、多模态微调 | DFW-1 / IAD-1 / LAS-1 | ₮4,308 | 部署 |
8 × B200 HGX 整机 ₮29,632/月(ORD-1,预订,9 月 15 日起交付)。多机训练按节点数预约,最短 1 个月,16 节点以上请提前两周联系商务。
- PyTorch 2.5CUDA 12.4
- PyTorch 2.6CUDA 12.8 · B200
- DeepSpeed 0.15
- Megatron-LMcore 0.9
- NCCL 2.22
- Transformers 4.46PEFT · TRL
- LLaMA-Factory 0.9
- Axolotl 0.5
- FlashAttention 2.7
- JupyterLab 4.2
- Ubuntu 22.04 纯净驱动 560
- 配置
- 2 × (8 × H100 SXM) + IB
- 月成本
- ₮30,064
- 迁移前
- 约 ₮48,500 / 月
- 节省
- 38%
训练实例附带
- 快照含 1 份,续费前自动提醒
- 故障硬件故障 30 分钟内迁移或换机
- 存储并行存储卷 ₮0.08/GB/月,同机房挂载
- 裸金属4 卡以上免费,约 20 分钟部署
- 升级周期内可加卡,差价按剩余天数折算
推理 API 与私有部署
把 GPU 云服务器当成自己的一台机器:7×24 在线的服务,要的是稳定、便宜、有固定入口。
按秒计费的平台适合突发流量,但一个全天在线的 API,月底账单往往比月租贵 40% 以上,还要处理冷启动、抢占和代理端口。在gpuli.com,每个实例自带一个美国公网 IPv4,端口直接对外,把域名解析过来就是你的 API 网关;模型、日志与用户数据都留在你的实例里,我们不看、也没有内容审核。需要多张卡做张量并行时,2 / 4 卡为同节点 NVLink,不是拼出来的多实例。
| 配置 | 显存 | 适合 | 机房 | 月租 | |
|---|---|---|---|---|---|
| 1 × L40S 48GB Ada · FP8 · 被动散热 | 48 GB | 7B–14B FP16 或 32B AWQ / GPTQ,vLLM 并发 32–64 | 四机房 | ₮649 | 部署 |
| 1 × H200 141GB Hopper · FP8 · 单卡跑 70B | 141 GB | 70B FP8 单卡、128K 长上下文 KV Cache | DFW-1 / ORD-1 | ₮2,599 | 部署 |
| 2 × H100 PCIe 80GB NVLink 桥接 · 张量并行 | 160 GB | 70B AWQ 高并发、32B FP16 张量并行、多模型混部 | DFW-1 / IAD-1 / LAS-1 | ₮3,067 | 部署 |
| 4 × RTX 4090 24GB 四卡独立 · 小模型多副本 | 96 GB | 多个 7B 副本、Embedding / Rerank / Whisper 服务 | 四机房 | ₮1,446 | 部署 |
- vLLM 0.6OpenAI 兼容
- SGLang 0.3
- Ollama 0.4
- TGI 2.3
- TensorRT-LLM 0.13
- Triton Server 24.09
- Open WebUI
- LiteLLM网关
- Xinference 0.16
- faster-whisper 1.0
- Nginx + Certbot反代与证书
- 配置
- 2 × H100 PCIe · LAS-1
- 月成本
- ₮3,067
- 迁移前
- token 计费约 ₮5,200 / 月
- 节省
- 41%
推理实例附带
- IPv4含 1 个,固定不变;加购 ₮4/个/月
- 端口全端口开放,可自配防火墙
- 带宽25 Gbps 共享出口,不限流量
- 独享10 Gbps 独享出口 ₮180/月
- DDoS基础清洗,L4 层默认开启
渲染、Stable Diffusion 与视频生成
出图、炼丹、渲染动画:接了单租一周,交付了就释放。周租在这里最常用。
RTX 4090 / 5090 的 FP16 与 FP8 算力对 SDXL、FLUX.1 与 Wan 2.1 这类模型绰绰有余,模型与素材直接放在 NVMe 系统盘,不用每次从对象存储拉。需要 48 GB 显存跑大场景 Blender 或 Unreal,选 RTX 6000 Ada 或 L40S。所有渲染镜像可换成 Windows Server 2022 桌面版(₮25/月,仅 PCIe 卡型),通过 RDP 或 Parsec 连接,显示输出走虚拟显示器;从香港连 LAS-1 的操作延迟在 150 ms 上下,调参数没有问题,实时预览建议放本地。
| 配置 | 显存 | 适合 | 周租 | 月租 | |
|---|---|---|---|---|---|
| 1 × RTX 4090 Ada · 24 GB GDDR6X | 24 GB | SDXL / FLUX.1 schnell 出图、ComfyUI 工作流、LoRA 训练 | ₮109 | ₮369 | 部署 |
| 1 × RTX 5090新品 Blackwell · 32 GB GDDR7 · FP4 | 32 GB | FLUX.1 dev FP16、Wan 2.1 / HunyuanVideo 视频生成 | ₮149 | ₮499 | 部署 |
| 4 × RTX 4090 四卡独立 · 队列并行 | 96 GB | 批量出图队列、Blender Cycles 多卡渲染、多人共用 | ₮427 | ₮1,446 | 部署 |
| 1 × RTX 6000 Ada Ada · 48 GB · 工作站驱动 | 48 GB | Unreal 5.4 大场景、Blender 8K 贴图、Houdini 流体 | ₮169 | ₮579 | 部署 |
- ComfyUI含 Manager
- Automatic1111 1.10
- Fooocus 2.5
- Kohya_ssLoRA 训练
- Wan 2.1 / CogVideoX
- Blender 4.2 LTS
- Unreal Engine 5.4
- Houdini 20.5自带许可证
- Windows Server 2022桌面 · ₮25/月
- Parsec / Sunshine串流
- 配置
- 4 × 4090 + 2 × 5090 · DFW-1
- 月成本
- ₮2,434 + 按需周租
- 迁移前
- 约 ₮2,800 / 月,且高峰排队
- 出图等待
- 平均 40 分钟 → 0
渲染实例附带
- 模型库常用 checkpoint 与 LoRA 机房内网镜像,秒级下载
- 素材盘存储卷可挂到多台实例,₮0.08/GB/月
- 桌面Windows 镜像含 RDP,虚拟显示器 4K
- 周转月周租到期前升级为月租,已付按剩余天数折抵
科研与个人开发者
便宜、随时开、随时关、Jupyter 打开就能写代码。
学生、博士生、独立开发者与刚起步的小团队,不需要 8 卡整机,需要的是一张够用的显卡和一个开机就能跑模型的环境。24 GB 显存的 A5000、3090 与 L4 月租 ₮219 起,48 GB 的 A6000 不到 ₮400。镜像里预装 JupyterLab、Conda 与常用框架,开机 3 分钟后浏览器里就是 notebook;SSH 与 VS Code Remote 也都能连。不需要学校发票、不需要公司主体,一个邮箱、一点 USDT。到期不续费,数据保留 7 天,续上就恢复。
| 配置 | 显存 | 适合 | 周租 | 月租 | |
|---|---|---|---|---|---|
| 1 × RTX A5000 Ampere · 24 GB · 6 vCPU / 31 GB | 24 GB | 课程作业、Kaggle、小模型实验、数据处理 | ₮65 | ₮219 | 部署 |
| 1 × RTX 3090 Ampere · 24 GB · 8 vCPU / 31 GB | 24 GB | 7B LoRA、CV / 语音训练、复现论文 | ₮75 | ₮249 | 部署 |
| 1 × NVIDIA L4 Ada · 24 GB · 72 W 低功耗 | 24 GB | 长期挂机、轻量推理、Embedding、数据标注 | ₮72 | ₮239 | 部署 |
| 1 × RTX A6000 Ampere · 48 GB · 10 vCPU / 62 GB | 48 GB | 13B 全参微调、3D 视觉、NeRF / 3DGS、医学影像 | ₮115 | ₮389 | 部署 |
- JupyterLab 4.2
- PyTorch 2.5CUDA 12.4
- TensorFlow 2.17
- JAX 0.4
- Miniconda 24
- R 4.4 + RStudio Server
- code-server 4.93
- MATLAB R2024b自带许可证
- Ubuntu 22.04 / 24.04纯净
- 配置
- 1 × 3090 → 1 × A6000 · LAS-1
- 月成本
- ₮249 → ₮389
- 排队
- 校内 5–7 天 → 0
- 报销
- 钱包账单 PDF
个人用户常问
- 最短周租 7 天,₮65 起
- 关机周期内可停机,但不退费;数据保留
- 到期停机保留 7 天,续费即恢复
- 报销账单页可导出 PDF,无法币发票
- 退款创建后 1 小时内可退到余额
为什么是月租,不是按秒
按秒计费的算力租赁听起来灵活,但对跑得久的任务,它把三样东西拿走了。
下单时从余额一次扣完整个周期,之后的 30 天不会多出一分钱。没有按量计费的存储、出口流量、公网 IP、快照,都含在里面。一张 H100 SXM 每月 ₮1,899,折合每小时 ₮2.64,比按秒计费平台连续使用 30 天低 12%~34%,而且能提前写进预算。
付了月租的卡就是你的,不存在“出价更高者得”。训练不会在第 40 个小时被踢下线,推理服务不会因为库存紧张被回收。硬件故障是唯一的中断原因,我们 30 分钟内迁移或换机,并按 SLA 以 3 倍时长补偿。
每台实例自带一个美国公网 IPv4,续费不变,重启不变。API 网关、Webhook、白名单、DNS 一次配好就不用再动。按秒计费平台给的是代理端口,每次重建都换,长期在线的服务根本没法用。
本页最后更新: · 价格与库存以 GPU 租用价格 页为准