Ultralytics 平台云训练 GPU 实例选型与按小时定价全参考:从 RTX 2000 Ada 到 B300 的 26 种显卡对照指南
【免费下载链接】ultralyticsUltralytics YOLO26, YOLO11, YOLOv8 — object detection, instance segmentation, semantic segmentation, image classification, pose estimation, object tracking项目地址: https://gitcode.com/GitHub_Trending/ul/ultralytics
导读
本文围绕 Ultralytics 平台(Ultralytics Platform)云训练所开放的 26 种 NVIDIA GPU 实例,系统梳理每款显卡的架构代际、显存容量、按小时价格与官方推荐的适用场景,并结合仓库内 Cloud Training 与 Billing 文档,讲清"选卡如何影响账单""显存不足怎么处理""平台有哪些自动降级与免费升级机制"。读完本文,你将能够按数据集规模、模型大小与预算快速锁定合适的 GPU 实例,并准确预估一次 YOLO 云训练的成本。
GPU 参考表的定位:一份被四处复用的平台级宏
docs/macros/platform-gpu-table.md是 Ultralytics 文档体系中的一个Markdown 宏(macro)片段——它本身不含叙述性文字,而是以单一数据表格的形式集中维护平台全部可租用 GPU 的规格与价格。该文件并不需要读者单独访问,而是通过{% include "macros/platform-gpu-table.md" %}指令被嵌入到多个平台页面中,实现"一处维护、多处同步":
- 平台训练总览(第 78 行 include)
- 平台主页(第 375 行 include)
- Cloud Training 云训练指南(第 134 行,位于"Step 5: Select GPU"小节)
- Billing 账单与额度指南(第 211 行,位于"Training Costs"小节)
也就是说,你在平台训练对话框中选择 GPU,或者在账单页核对"Training Costs"时看到的显卡价格表,其数据源都来自同一个宏文件。这也是理解本文的起点:这份表不是某次促销,而是平台云训练实例的标准定价与规格基准。
26 种云训练 GPU 完整规格与定价表
下表完整取自 docs/macros/platform-gpu-table.md,按每小时价格从低到高排列:
| GPU | Generation | VRAM | Cost/Hour | Best For |
|---|---|---|---|---|
| RTX 2000 Ada | Ada | 16 GB | $0.24 | Small datasets, testing |
| RTX A4500 | Ampere | 20 GB | $0.25 | Small-medium datasets |
| RTX 4000 Ada | Ada | 20 GB | $0.26 | Medium datasets |
| RTX A5000 | Ampere | 24 GB | $0.27 | Medium datasets |
| L4 | Ada | 24 GB | $0.39 | Inference optimized |
| A40 | Ampere | 48 GB | $0.44 | Larger batch sizes |
| RTX 3090 | Ampere | 24 GB | $0.46 | General training |
| RTX A6000 | Ampere | 48 GB | $0.49 | Large models |
| RTX PRO 4000 | Blackwell | 24 GB | $0.57 | Budget Blackwell |
| RTX PRO 4500 | Blackwell | 32 GB | $0.64 | Great price/performance |
| RTX 4090 | Ada | 24 GB | $0.69 | Best price/performance |
| RTX 6000 Ada | Ada | 48 GB | $0.77 | Large batch training |
| L40S | Ada | 48 GB | $0.86 | Large batch training |
| RTX PRO 5000 | Blackwell | 48 GB | $0.96 | Large batch training |
| RTX 5090 | Blackwell | 32 GB | $0.99 | Latest consumer generation |
| L40 | Ada | 48 GB | $0.99 | Large models |
| A100 PCIe | Ampere | 80 GB | $1.39 | Production training |
| A100 SXM | Ampere | 80 GB | $1.49 | Production training |
| RTX PRO 6000 | Blackwell | 96 GB | $2.09 | Recommended default |
| H100 PCIe | Hopper | 80 GB | $2.89 | High-performance training |
| H100 NVL | Hopper | 94 GB | $3.19 | Maximum performance |
| H100 SXM | Hopper | 80 GB | $3.29 | Fastest training |
| H200 NVL | Hopper | 143 GB | $3.39 | Maximum memory |
| H200 SXM | Hopper | 141 GB | $4.39 | Maximum performance |
| B200 | Blackwell | 180 GB | $5.89 | Large models (Pro+) |
| B300 | Blackwell | 288 GB | $7.39 | Largest models (Pro+) |
关于可用范围的限制
需要特别注意访问权限的差异。根据 Billing 文档 的说明:
- B200 与 B300(表中 "Pro+" 标注)仅对 Pro 或 Enterprise 套餐开放;
- 其余全部 24 种 GPU 在 Free、Pro、Enterprise 所有套餐上均可使用。
这与 Billing 文档 中套餐描述的 GPU 数量相互印证:Free 套餐提供24 种云 GPU(覆盖 $0.24–$4.39/hr,包含 RTX 5090、H100 与 H200),Pro 套餐提供26 种 GPU(在 Free 基础上解锁 B200、B300 这两款旗舰)。
读表指南:四列信息分别说明什么
Generation:架构代际决定能效上限
表中共出现四代 NVIDIA 架构,对应四档定位:
- Ampere(RTX 3090、RTX A4500/A5000/A6000、A40、A100 PCIe/SXM)——表中定价最经济的专业/数据中心级选择,A100 系列负责生产级训练;
- Ada Lovelace(RTX 2000/4000 Ada、RTX 4090、RTX 6000 Ada、L4、L40/L40S)——消费级与专业级覆盖面最广的一代,"L4 面向推理优化、L40S 面向大 batch 训练"的定位差异清晰;
- Hopper(H100 PCIe/NVL/SXM、H200 NVL/SXM)——面向高性能与超大规模显存需求的数据中心代际;
- Blackwell(RTX PRO 4000/4500/5000/6000、RTX 5090、B200/B300)——最新代际,从入门级 Blackwell 到 288 GB 的 B300 都有覆盖。
一个值得注意的观察点:Blackwell 代际内部跨度极大——$0.57/hr 的 RTX PRO 4000 与 $7.39/hr 的 B300 同属 Blackwell,因此"选新架构"并不等于"选最贵",仍需结合显存与用途判断。
VRAM:决定 batch 与模型规模的上限
表中显存从 16 GB 到 288 GB 可分为几个梯度,结合 Cloud Training 文档 可对应不同的训练诉求:
| 显存梯度 | 代表实例 | 典型定位(依据表内 Best For) |
|---|---|---|
| 16–20 GB | RTX 2000 Ada、A4500、RTX 4000 Ada | 小数据集、冒烟测试、中小数据集起步 |
| 24 GB | A5000、L4、RTX 3090、A6000 之外的主流 24 GB 卡 | 通用训练、推理优化、性价比训练 |
| 32 GB | RTX PRO 4500、RTX 5090 | 高性价比、最新消费级 |
| 48 GB | A40、A6000、RTX 6000 Ada、L40/L40S、RTX PRO 5000 | 更大 batch、更大模型、大 batch 训练 |
| 80–96 GB | A100 系列、H100 系列、RTX PRO 6000 | 生产训练、推荐默认、高性能训练 |
| 141–180 GB | H200 NVL/SXM、B200 | 高显存负载、大模型(Pro+) |
| 288 GB | B300 | 最大规模模型(Pro+) |
显存的意义在于:更大的显存可以容纳更大的 batch size、更大的图像分辨率或更大的模型。这与平台训练对话框的 Batch Size 参数(-1表示按可用显存自动适配,范围 1–512)直接相关,也与 Cloud Training 文档 的提示一致——当图像尺寸超过 1280 时,显存占用、训练时间与费用都会大幅上升。
Cost/Hour:计费的核心单价
表中的时价即云训练计费的GPU Rate。价格从 $0.24/hr(RTX 2000 Ada)一路排到 $7.39/hr(B300),跨度约 30 倍。但正如后文将说明的,更高的时价往往意味着更短的训练时长,因此不能只看单价,还要结合"价格/性能"与任务 deadline 来权衡。
Best For:官方标注的推荐用途
最后一列是平台给出的首选场景标注,例如 "Small datasets, testing"、"Inference optimized"、"Large batch training"、"Production training" 等。它在速查时最具参考价值:如果你的任务是典型的"小数据集调通流程",完全没有必要选择表中高端的 Hopper/Blackwell 数据中心卡。
场景化选卡建议:平台文档给出的推荐组合
Cloud Training 文档 的 "GPU Selection" 提示给出了一套可直接照搬的选卡策略,可作为默认决策树:
| 场景 | 推荐 GPU | 理由 |
|---|---|---|
| 大多数任务的默认选择 | RTX PRO 6000(96 GB Blackwell,$2.09/hr) | 平台标注的 Recommended default |
| 大批量或较大模型 | A100 SXM(80 GB HBM2e,$1.49/hr) | 显存与带宽适合大 batch |
| 时间敏感的训练 | H100 PCIe / H100 SXM / H100 NVL(80–94 GB Hopper,$2.89–$3.29/hr) | 全套餐可用,训练最快梯队 |
| 高显存负载 | H200 NVL / H200 SXM(141–143 GB Hopper,$3.39–$4.39/hr) | 全套餐可用的最大显存梯队 |
| 尖端/超大模型工作负载 | B200 / B300(180–288 GB Blackwell) | 仅限 Pro 或 Enterprise 套餐 |
预算敏感时的替代思路
如果希望控制成本,可参考表内 "Best For" 的定位选择低价位替代:例如小数据集验证用 RTX 2000 Ada($0.24/hr)或 RTX A4500($0.25/hr),中等规模训练用 RTX A5000 / RTX 4000 Ada($0.26–$0.27/hr),追求性价比训练则看 RTX 4090($0.69/hr,标称 "Best price/performance")或 RTX PRO 4500($0.64/hr,标称 "Great price/performance")。另外平台文档还明确提醒,预算不足以承担大显存卡时,遇到显存溢出(Out of memory)应降低 batch size 或换用更大显存的 GPU。
GPU 如何决定账单:计费模型与成本估算
基本公式
Cloud Training 文档 与 Billing 文档 给出的计费规则完全一致:
Total Cost = GPU Rate × Training Time (hours)示例(来自 Billing 文档):在 RTX PRO 6000 上训练 2.5 小时:
$2.09 × 2.5 = $5.23账单按实际 GPU 用时结算,而非估算值。平台在训练启动前依据模型大小、数据集大小、epochs、图像尺寸、batch size 与 GPU 型号给出总时长与费用的估算,并在训练对话框中以成本卡片形式展示(同时显示预计每 epoch 秒数与数据集图片数);实际用量按量计费。
影响成本的关键因素
Cloud Training 文档 的成本影响因子表是估算费用的核心依据:
| 因子 | 影响 |
|---|---|
| 数据集大小 | 图片越多训练越久(计算量大致随数据集线性增长) |
| 模型大小 | m/l/x 等大模型比 n/s 训练更慢 |
| epochs 数量 | 对训练时间构成直接乘数 |
| 图像尺寸 | imgsz 越大计算量越大——1280px 的成本约为 640px 的数倍 |
| batch size | 更大的 batch 训练效率更高 |
| GPU 速度 | 更快的 GPU 缩短训练时长,部分抵消其更高的时价 |
| 优化器 | MuSGD耗时约为其他优化器的两倍 |
| 启动开销 | 实例初始化、数据下载与预热最多约 5 分钟(随数据集规模增大) |
真实成本量级参考
Cloud Training 文档 给出了三组基于真实云训练的估算示例,可帮助你建立价格直觉:
| 场景 | GPU | 预估成本 |
|---|---|---|
| 500 张图片、YOLO26n、50 epochs | RTX 4090 | ~$0.03 |
| 1000 张图片、YOLO26n、100 epochs | RTX PRO 6000 | ~$0.23 |
| 5000 张图片、YOLO26s、100 epochs | H100 SXM | ~$1.56 |
需要说明:上述为估算值,实际费用取决于数据加载速度、GPU 预热与模型收敛行为等多种因素,训练对话框中的实时估算才是更准确的参考。
平台在 GPU 层面的两套自动保护机制
在选卡与计费之外,平台文档还描述了两套对用户成本影响很大的自动化机制,值得在选卡前了解:
1. 实时容量与自动故障转移(Live Capacity & Automatic Failover)
Cloud Training 文档 说明,训练对话框中的 GPU 选择器反映的是实时云库存,容量不足的选项会被标记。当任务无法在所选 GPU 上被调度时,平台会报告容量短缺并自动切换到最接近的可用 GPU——切换优先级是:先匹配显存,其次速度,再次价格——同时告知你新的显存与小时费率,你可以立即开始或重新选择。
2. 免费 GPU 升级(Free GPU Upgrades)
这是对预算型用户最友好的一条规则:选择比 RTX PRO 6000 更便宜的 GPU,你的任务即具备运行在 Ultralytics 托管基础设施上的资格。当该容量空闲时,任务实际跑在 RTX PRO 6000 上,却仍按你选择的 GPU 价格计费——也就是说,任务可能以更快速度完成且花费更少。文档同时保证:升级永远不会让你的运行更慢或更贵。
3. 余额校验与计量结算
在费用安全层面,Cloud Training 文档 还明确了两条计费纪律:
- 训练启动要求余额为正且足以覆盖估算任务成本——每份估算至少预留15 分钟 GPU 时间;多个任务并行时还会计入它们尚未结算的余额部分;
- 计费按实际 GPU 时间进行,取消、失败、卡死(Stuck)等终态任务都会结算已发生的 GPU 用时,仅"云 GPU 尚未启动前的校验/启动失败"不产生费用。
源码侧印证:"显存够不够用"与 batch 自动适配机制
GPU 显存对训练最直接的影响就是 batch size。在仓库的本地训练实现中,batch取值支持-1(自动适配)或浮点数(表示占用可用显存的比例)。相关机制在 ultralytics/utils/autobatch.py 中实现:check_train_batch_size()会在训练前对模型做内存剖析,估算"能够利用指定比例显存"的最优 batch size;其默认比例为0.6,即自动模式下通常按可用显存的 60% 来拟合 batch。
在 ultralytics/engine/trainer.py 中,当batch_size < 1(单 GPU 训练)时会调用auto_batch()完成这一自动适配(见if self.batch_size < 1 and RANK == -1分支),而 ultralytics/cfg/default.yaml 中的batch: 16则提供了未开启自动模式时的基准值。这套"显存越大 → 自动拟合的 batch 越大 → 单次迭代吞吐越高"的链路,正是云训练中高显存 GPU 能显著缩短训练时间的底层原因之一。
平台云训练对话框把 Batch Size 的默认值设为-1 (auto)(自动按可用显存适配,范围 1–512),与仓库中 autobatch 的语义一致。因此在云端选卡时,更高的 VRAM 通常意味着更大的自动 batch,这也是 48 GB / 80 GB 以上实例被标注为 "Large batch training" 或 "Production training" 的原因。
实战:把成本控制在预算内的四个步骤
综合 Cloud Training 文档 的 "Cost-Saving Strategies" 与表格数据,一套可落地的成本控制路径如下:
- 先用小卡验证,再上大卡:以 10–20 个 epochs 在 RTX 2000 Ada / RTX A4500($0.24–$0.25/hr)这类低价实例上验证数据集与配置的正确性,避免把昂贵的 GPU 时间浪费在报错排查上;
- 默认选 RTX PRO 6000:大多数工作负载的推荐默认,避免在选型上过度纠结;同时记得利用"免费 GPU 升级"规则——选择更便宜的卡有时反而能以更低价格享受更快算力;
- 提前校验数据集:在投入训练前修正标注问题(例如低质量的标签),数据集校验失败不会产生 GPU 费用;
- 尽早监控与止损:若 loss 早早进入平台期,及时取消任务——取消只结算已发生的 GPU 用时。
结论
docs/macros/platform-gpu-table.md虽以宏片段形式存在,却是 Ultralytics 平台云训练选型的"唯一事实来源":26 种 GPU 的架构代际、显存、时价与推荐用途被四份平台文档统一引用。理解这张表的结构(价格梯度、显存梯度、Pro+ 限制)并配合平台文档中的计费公式、自动故障转移与免费升级机制,即可在预算、速度与模型规模之间做出理性权衡。如需进一步阅读:
- macros/platform-gpu-table.md:GPU 表格宏本身
- platform/train/cloud-training.md:云端训练全流程、GPU 选择步骤与成本估算
- platform/account/billing.md:套餐对比、余额与账单结算
- usage/cfg.md:训练参数(batch、imgsz 等)的完整说明
- ultralytics/utils/autobatch.py:自动 batch 适配的源码实现
【免费下载链接】ultralyticsUltralytics YOLO26, YOLO11, YOLOv8 — object detection, instance segmentation, semantic segmentation, image classification, pose estimation, object tracking项目地址: https://gitcode.com/GitHub_Trending/ul/ultralytics
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考