Ultralytics 平台云训练 GPU 实例选型与按小时定价全参考:从 RTX 2000 Ada 到 B300 的 26 种显卡对照指南
2026/9/9 21:45:32 网站建设 项目流程

Ultralytics 平台云训练 GPU 实例选型与按小时定价全参考:从 RTX 2000 Ada 到 B300 的 26 种显卡对照指南

【免费下载链接】ultralyticsUltralytics YOLO26, YOLO11, YOLOv8 — object detection, instance segmentation, semantic segmentation, image classification, pose estimation, object tracking项目地址: https://gitcode.com/GitHub_Trending/ul/ultralytics

导读

本文围绕 Ultralytics 平台(Ultralytics Platform)云训练所开放的 26 种 NVIDIA GPU 实例,系统梳理每款显卡的架构代际、显存容量、按小时价格与官方推荐的适用场景,并结合仓库内 Cloud Training 与 Billing 文档,讲清"选卡如何影响账单""显存不足怎么处理""平台有哪些自动降级与免费升级机制"。读完本文,你将能够按数据集规模、模型大小与预算快速锁定合适的 GPU 实例,并准确预估一次 YOLO 云训练的成本。

GPU 参考表的定位:一份被四处复用的平台级宏

docs/macros/platform-gpu-table.md是 Ultralytics 文档体系中的一个Markdown 宏(macro)片段——它本身不含叙述性文字,而是以单一数据表格的形式集中维护平台全部可租用 GPU 的规格与价格。该文件并不需要读者单独访问,而是通过{% include "macros/platform-gpu-table.md" %}指令被嵌入到多个平台页面中,实现"一处维护、多处同步":

  • 平台训练总览(第 78 行 include)
  • 平台主页(第 375 行 include)
  • Cloud Training 云训练指南(第 134 行,位于"Step 5: Select GPU"小节)
  • Billing 账单与额度指南(第 211 行,位于"Training Costs"小节)

也就是说,你在平台训练对话框中选择 GPU,或者在账单页核对"Training Costs"时看到的显卡价格表,其数据源都来自同一个宏文件。这也是理解本文的起点:这份表不是某次促销,而是平台云训练实例的标准定价与规格基准

26 种云训练 GPU 完整规格与定价表

下表完整取自 docs/macros/platform-gpu-table.md,按每小时价格从低到高排列:

GPUGenerationVRAMCost/HourBest For
RTX 2000 AdaAda16 GB$0.24Small datasets, testing
RTX A4500Ampere20 GB$0.25Small-medium datasets
RTX 4000 AdaAda20 GB$0.26Medium datasets
RTX A5000Ampere24 GB$0.27Medium datasets
L4Ada24 GB$0.39Inference optimized
A40Ampere48 GB$0.44Larger batch sizes
RTX 3090Ampere24 GB$0.46General training
RTX A6000Ampere48 GB$0.49Large models
RTX PRO 4000Blackwell24 GB$0.57Budget Blackwell
RTX PRO 4500Blackwell32 GB$0.64Great price/performance
RTX 4090Ada24 GB$0.69Best price/performance
RTX 6000 AdaAda48 GB$0.77Large batch training
L40SAda48 GB$0.86Large batch training
RTX PRO 5000Blackwell48 GB$0.96Large batch training
RTX 5090Blackwell32 GB$0.99Latest consumer generation
L40Ada48 GB$0.99Large models
A100 PCIeAmpere80 GB$1.39Production training
A100 SXMAmpere80 GB$1.49Production training
RTX PRO 6000Blackwell96 GB$2.09Recommended default
H100 PCIeHopper80 GB$2.89High-performance training
H100 NVLHopper94 GB$3.19Maximum performance
H100 SXMHopper80 GB$3.29Fastest training
H200 NVLHopper143 GB$3.39Maximum memory
H200 SXMHopper141 GB$4.39Maximum performance
B200Blackwell180 GB$5.89Large models (Pro+)
B300Blackwell288 GB$7.39Largest models (Pro+)

关于可用范围的限制

需要特别注意访问权限的差异。根据 Billing 文档 的说明:

  • B200 与 B300(表中 "Pro+" 标注)仅对 Pro 或 Enterprise 套餐开放;
  • 其余全部 24 种 GPU 在 Free、Pro、Enterprise 所有套餐上均可使用

这与 Billing 文档 中套餐描述的 GPU 数量相互印证:Free 套餐提供24 种云 GPU(覆盖 $0.24–$4.39/hr,包含 RTX 5090、H100 与 H200),Pro 套餐提供26 种 GPU(在 Free 基础上解锁 B200、B300 这两款旗舰)。

读表指南:四列信息分别说明什么

Generation:架构代际决定能效上限

表中共出现四代 NVIDIA 架构,对应四档定位:

  • Ampere(RTX 3090、RTX A4500/A5000/A6000、A40、A100 PCIe/SXM)——表中定价最经济的专业/数据中心级选择,A100 系列负责生产级训练;
  • Ada Lovelace(RTX 2000/4000 Ada、RTX 4090、RTX 6000 Ada、L4、L40/L40S)——消费级与专业级覆盖面最广的一代,"L4 面向推理优化、L40S 面向大 batch 训练"的定位差异清晰;
  • Hopper(H100 PCIe/NVL/SXM、H200 NVL/SXM)——面向高性能与超大规模显存需求的数据中心代际;
  • Blackwell(RTX PRO 4000/4500/5000/6000、RTX 5090、B200/B300)——最新代际,从入门级 Blackwell 到 288 GB 的 B300 都有覆盖。

一个值得注意的观察点:Blackwell 代际内部跨度极大——$0.57/hr 的 RTX PRO 4000 与 $7.39/hr 的 B300 同属 Blackwell,因此"选新架构"并不等于"选最贵",仍需结合显存与用途判断。

VRAM:决定 batch 与模型规模的上限

表中显存从 16 GB 到 288 GB 可分为几个梯度,结合 Cloud Training 文档 可对应不同的训练诉求:

显存梯度代表实例典型定位(依据表内 Best For)
16–20 GBRTX 2000 Ada、A4500、RTX 4000 Ada小数据集、冒烟测试、中小数据集起步
24 GBA5000、L4、RTX 3090、A6000 之外的主流 24 GB 卡通用训练、推理优化、性价比训练
32 GBRTX PRO 4500、RTX 5090高性价比、最新消费级
48 GBA40、A6000、RTX 6000 Ada、L40/L40S、RTX PRO 5000更大 batch、更大模型、大 batch 训练
80–96 GBA100 系列、H100 系列、RTX PRO 6000生产训练、推荐默认、高性能训练
141–180 GBH200 NVL/SXM、B200高显存负载、大模型(Pro+)
288 GBB300最大规模模型(Pro+)

显存的意义在于:更大的显存可以容纳更大的 batch size、更大的图像分辨率或更大的模型。这与平台训练对话框的 Batch Size 参数(-1表示按可用显存自动适配,范围 1–512)直接相关,也与 Cloud Training 文档 的提示一致——当图像尺寸超过 1280 时,显存占用、训练时间与费用都会大幅上升。

Cost/Hour:计费的核心单价

表中的时价即云训练计费的GPU Rate。价格从 $0.24/hr(RTX 2000 Ada)一路排到 $7.39/hr(B300),跨度约 30 倍。但正如后文将说明的,更高的时价往往意味着更短的训练时长,因此不能只看单价,还要结合"价格/性能"与任务 deadline 来权衡。

Best For:官方标注的推荐用途

最后一列是平台给出的首选场景标注,例如 "Small datasets, testing"、"Inference optimized"、"Large batch training"、"Production training" 等。它在速查时最具参考价值:如果你的任务是典型的"小数据集调通流程",完全没有必要选择表中高端的 Hopper/Blackwell 数据中心卡。

场景化选卡建议:平台文档给出的推荐组合

Cloud Training 文档 的 "GPU Selection" 提示给出了一套可直接照搬的选卡策略,可作为默认决策树:

场景推荐 GPU理由
大多数任务的默认选择RTX PRO 6000(96 GB Blackwell,$2.09/hr)平台标注的 Recommended default
大批量或较大模型A100 SXM(80 GB HBM2e,$1.49/hr)显存与带宽适合大 batch
时间敏感的训练H100 PCIe / H100 SXM / H100 NVL(80–94 GB Hopper,$2.89–$3.29/hr)全套餐可用,训练最快梯队
高显存负载H200 NVL / H200 SXM(141–143 GB Hopper,$3.39–$4.39/hr)全套餐可用的最大显存梯队
尖端/超大模型工作负载B200 / B300(180–288 GB Blackwell)仅限 Pro 或 Enterprise 套餐

预算敏感时的替代思路

如果希望控制成本,可参考表内 "Best For" 的定位选择低价位替代:例如小数据集验证用 RTX 2000 Ada($0.24/hr)或 RTX A4500($0.25/hr),中等规模训练用 RTX A5000 / RTX 4000 Ada($0.26–$0.27/hr),追求性价比训练则看 RTX 4090($0.69/hr,标称 "Best price/performance")或 RTX PRO 4500($0.64/hr,标称 "Great price/performance")。另外平台文档还明确提醒,预算不足以承担大显存卡时,遇到显存溢出(Out of memory)应降低 batch size 或换用更大显存的 GPU

GPU 如何决定账单:计费模型与成本估算

基本公式

Cloud Training 文档 与 Billing 文档 给出的计费规则完全一致:

Total Cost = GPU Rate × Training Time (hours)

示例(来自 Billing 文档):在 RTX PRO 6000 上训练 2.5 小时:

$2.09 × 2.5 = $5.23

账单按实际 GPU 用时结算,而非估算值。平台在训练启动前依据模型大小、数据集大小、epochs、图像尺寸、batch size 与 GPU 型号给出总时长与费用的估算,并在训练对话框中以成本卡片形式展示(同时显示预计每 epoch 秒数与数据集图片数);实际用量按量计费。

影响成本的关键因素

Cloud Training 文档 的成本影响因子表是估算费用的核心依据:

因子影响
数据集大小图片越多训练越久(计算量大致随数据集线性增长)
模型大小m/l/x 等大模型比 n/s 训练更慢
epochs 数量对训练时间构成直接乘数
图像尺寸imgsz 越大计算量越大——1280px 的成本约为 640px 的数倍
batch size更大的 batch 训练效率更高
GPU 速度更快的 GPU 缩短训练时长,部分抵消其更高的时价
优化器MuSGD耗时约为其他优化器的两倍
启动开销实例初始化、数据下载与预热最多约 5 分钟(随数据集规模增大)

真实成本量级参考

Cloud Training 文档 给出了三组基于真实云训练的估算示例,可帮助你建立价格直觉:

场景GPU预估成本
500 张图片、YOLO26n、50 epochsRTX 4090~$0.03
1000 张图片、YOLO26n、100 epochsRTX PRO 6000~$0.23
5000 张图片、YOLO26s、100 epochsH100 SXM~$1.56

需要说明:上述为估算值,实际费用取决于数据加载速度、GPU 预热与模型收敛行为等多种因素,训练对话框中的实时估算才是更准确的参考。

平台在 GPU 层面的两套自动保护机制

在选卡与计费之外,平台文档还描述了两套对用户成本影响很大的自动化机制,值得在选卡前了解:

1. 实时容量与自动故障转移(Live Capacity & Automatic Failover)

Cloud Training 文档 说明,训练对话框中的 GPU 选择器反映的是实时云库存,容量不足的选项会被标记。当任务无法在所选 GPU 上被调度时,平台会报告容量短缺并自动切换到最接近的可用 GPU——切换优先级是:先匹配显存,其次速度,再次价格——同时告知你新的显存与小时费率,你可以立即开始或重新选择。

2. 免费 GPU 升级(Free GPU Upgrades)

这是对预算型用户最友好的一条规则:选择比 RTX PRO 6000 更便宜的 GPU,你的任务即具备运行在 Ultralytics 托管基础设施上的资格。当该容量空闲时,任务实际跑在 RTX PRO 6000 上,却仍按你选择的 GPU 价格计费——也就是说,任务可能以更快速度完成且花费更少。文档同时保证:升级永远不会让你的运行更慢或更贵。

3. 余额校验与计量结算

在费用安全层面,Cloud Training 文档 还明确了两条计费纪律:

  • 训练启动要求余额为正且足以覆盖估算任务成本——每份估算至少预留15 分钟 GPU 时间;多个任务并行时还会计入它们尚未结算的余额部分;
  • 计费按实际 GPU 时间进行,取消、失败、卡死(Stuck)等终态任务都会结算已发生的 GPU 用时,仅"云 GPU 尚未启动前的校验/启动失败"不产生费用。

源码侧印证:"显存够不够用"与 batch 自动适配机制

GPU 显存对训练最直接的影响就是 batch size。在仓库的本地训练实现中,batch取值支持-1(自动适配)或浮点数(表示占用可用显存的比例)。相关机制在 ultralytics/utils/autobatch.py 中实现:check_train_batch_size()会在训练前对模型做内存剖析,估算"能够利用指定比例显存"的最优 batch size;其默认比例为0.6,即自动模式下通常按可用显存的 60% 来拟合 batch。

在 ultralytics/engine/trainer.py 中,当batch_size < 1(单 GPU 训练)时会调用auto_batch()完成这一自动适配(见if self.batch_size < 1 and RANK == -1分支),而 ultralytics/cfg/default.yaml 中的batch: 16则提供了未开启自动模式时的基准值。这套"显存越大 → 自动拟合的 batch 越大 → 单次迭代吞吐越高"的链路,正是云训练中高显存 GPU 能显著缩短训练时间的底层原因之一。

平台云训练对话框把 Batch Size 的默认值设为-1 (auto)(自动按可用显存适配,范围 1–512),与仓库中 autobatch 的语义一致。因此在云端选卡时,更高的 VRAM 通常意味着更大的自动 batch,这也是 48 GB / 80 GB 以上实例被标注为 "Large batch training" 或 "Production training" 的原因。

实战:把成本控制在预算内的四个步骤

综合 Cloud Training 文档 的 "Cost-Saving Strategies" 与表格数据,一套可落地的成本控制路径如下:

  1. 先用小卡验证,再上大卡:以 10–20 个 epochs 在 RTX 2000 Ada / RTX A4500($0.24–$0.25/hr)这类低价实例上验证数据集与配置的正确性,避免把昂贵的 GPU 时间浪费在报错排查上;
  2. 默认选 RTX PRO 6000:大多数工作负载的推荐默认,避免在选型上过度纠结;同时记得利用"免费 GPU 升级"规则——选择更便宜的卡有时反而能以更低价格享受更快算力;
  3. 提前校验数据集:在投入训练前修正标注问题(例如低质量的标签),数据集校验失败不会产生 GPU 费用;
  4. 尽早监控与止损:若 loss 早早进入平台期,及时取消任务——取消只结算已发生的 GPU 用时。

结论

docs/macros/platform-gpu-table.md虽以宏片段形式存在,却是 Ultralytics 平台云训练选型的"唯一事实来源":26 种 GPU 的架构代际、显存、时价与推荐用途被四份平台文档统一引用。理解这张表的结构(价格梯度、显存梯度、Pro+ 限制)并配合平台文档中的计费公式、自动故障转移与免费升级机制,即可在预算、速度与模型规模之间做出理性权衡。如需进一步阅读:

  • macros/platform-gpu-table.md:GPU 表格宏本身
  • platform/train/cloud-training.md:云端训练全流程、GPU 选择步骤与成本估算
  • platform/account/billing.md:套餐对比、余额与账单结算
  • usage/cfg.md:训练参数(batch、imgsz 等)的完整说明
  • ultralytics/utils/autobatch.py:自动 batch 适配的源码实现

【免费下载链接】ultralyticsUltralytics YOLO26, YOLO11, YOLOv8 — object detection, instance segmentation, semantic segmentation, image classification, pose estimation, object tracking项目地址: https://gitcode.com/GitHub_Trending/ul/ultralytics

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询