超节点 GPU 数量为什么是 8、72、128、144、576?——数字背后的工程逻辑、行业主流超节点盘点、国内"拼多卡"vs 国外"单卡高性能"路线之争
本文作为笔者个人备忘的文章,不喜勿喷。以及 AI 生成。不构成投资建议。本文基于 NVIDIA 官方博客(GB200 NVL72 与 Dynamo)、中兴通讯超节点白皮书、东吴/华泰/国泰君安等券商研报、环球网/艾媒/新浪(华为 Atlas 950 真机、NVL144/NVL576 对标)、《财经》客户端(昇腾 960/4096 卡)、证券之星(国产超节点量产元年)、CSDN/博客园(GB200 NVL72 架构)等公开资料,系统性回答"为什么超节点 GPU 数量常是 8、72、128、144、576(尤其 72 的倍数)"、盘点行业主流超节点,并深度对比国内"拼多卡"路线 vs 国外"单卡高性能"路线。
一、这些数字的来历:从 8 到 72 到 576 的工程进化
1.18:第一代 Scale-up 域的上限
| 阶段 | GPU 数量 | 来源 |
|---|---|---|
| HGX H100/H200(第 1/2/3/4 代 NVLink) | 8 卡 | 单个 NVLink 域最多连接8 个 GPU(900GB/s),即 DGX/HGX 8 卡标准 |
| PCIe 时代 | 4-8 卡 | PCIe 总线带宽有限 |
为什么是 8: - 早期 NVLink 通过NVSwitch实现全互联,受交换芯片端口数、板卡供电、机箱散热限制 - 8 卡是"成本 × 带宽 × 密度"的工程平衡点(8×80GB=640GB 显存、可装下 70B 模型) - 是后来所有超节点数量的"基本单元"
1.272:NVL72 的里程碑——为什么不是 64/80/96?
NVIDIA 在 GB200 时代将单个 Scale-up(NVLink 域)从 8 卡跃升至72 卡。
| 维度 | NVL72 关键结构 |
|---|---|
| 基本单元 | GB200 Superchip = 1 个 Grace CPU + 2 个 Blackwell GPU(NVLink-C2C 900GB/s) |
| 机柜组成 | 36 个 Superchip × 2 GPU = 72 GPU,或 18 计算托盘 × 4 GPU |
| 互联 | 第 5 代 NVSwitch,单卡 NVLink 1.8 TB/s,GPU 间总带宽130 TB/s |
| 统一内存 | 72 GPU 共享统一内存空间(72×80GB ≈ 5.76TB) |
| 设计目标 | 专为 MoE 模型(EP=64 专家并行)与 Llama 70B 等稠密模型服务 |
72 的数学/工程根源: -72 = 2³ × 3²,因数丰富,易做拓扑切分(可分 2/3/4/6/8/9/12/18/24/36/72) -由超芯片结构决定:36 个 Grace-Blackwell(每芯片 2 GPU)→ 36×2 = 72,是"超级芯片 ×2"的自然结果 -受单机柜物理限制:供电(~120kW+)、液冷散热、NVSwitch 端口数决定一柜只能容纳约 72 GPU - 72 正好承载MoE EP=64(专家并行 64)所需的 GPU 规模,与模型并行需求强耦合
1.3144、576:72 的倍数=Scale-up 域级联
| 数字 | 组成 | 含义 |
|---|---|---|
| NVL36 | 18 超芯片 × 2 | 半柜/入门超节点 |
| NVL72 | 36 超芯片 × 2 | 标准单柜超节点 |
| NVL144 | 2 × 72 | 双柜级超节点(英伟达新一代对标基准) |
| NVL576 | 8 × 72 = 576 | 8 个机柜 × 72 GPU 纳入同一高速互联系统(英伟达2027 年 Rubin Ultra计划,NVLink 光互联) |
关键规律:576 = 8 × 72、144 = 2 × 72——超节点数字都是"以 72 为基数、按柜数或域数级联",因为 Scale-up 域以 72 GPU(NVL72)为一个"原子单元",多域堆叠成更大超节点。中兴白皮书确认:英伟达通过 NVLink 光互联扩展至576 卡集群超节点。
1.4 其他主流数字:128/384/512/640/1024/4096
| 数字 | 厂商/产品 | 说明 |
|---|---|---|
| 128 | 阿里磐久AL128 | 云侧资源池化、单级交换重构超节点 |
| 384 | 华为Atlas 900 A3 | 早期国产超节点 |
| 512 | 阿里 UPN512 | 单层光互联 512 xPU Scale-up 网络 |
| 640 / 1280 | 中科曙光scaleX640 | 单机柜 640 卡、双柜 1280 卡,算力 600+ PFLOPs |
| 1024 | 华为 950 系列 | 上一代超节点集群 |
| 4096 | 华为昇腾 960 | 新一代超节点集群规模 4096 卡 |
| 8192 / 15488 | 华为 Atlas 950/960 | 单系统最多互联卡片数 |
国内数字(128/384/512/640)源于各厂商自研"超节点原子单元"规模;华为走"超大超节点"(千卡级 Scale-up 域),英伟达走"72 卡原子单元逐柜级联"。
二、行业主流超节点全景盘点(2025-2026)
| 阵营 | 厂商 | 超节点 | GPU 数 | 关键特性 |
|---|---|---|---|---|
| 海外 | 英伟达 | GB200/GB300NVL72 | 72 | NVLink 5、1.8TB/s、MoE 优化 |
| 英伟达 | NVL576(规划 2027) | 576 | Rubin Ultra、8 柜光互联 | |
| AMD | Helios | 72 | MI455X + UALoE、对标 NVL72 | |
| 国内 | 华为 | Atlas 900 A3 | 384 | 自研 HCCS/灵衢 UB |
| 华为 | Atlas 950/960 | 1024→4096/8192 | 业界最大规模商用超节点 | |
| 中科曙光 | scaleX640 | 640/1280 | 高密架构+浸没液冷、开放 | |
| 阿里 | 磐久AL128/UPN512 | 128/512 | 云资源池化、单级交换 | |
| 字节跳动 | EthLink | — | 以太网 Scale-up 协议 | |
| 腾讯 | ETH-X | — | 以太网 Scale-up | |
| 浪潮 | 元脑SD200 | — | 高密定制 |
趋势(东吴/华泰): - 中国移动 2026-2027 超节点集采20 亿+- 华泰测算2028 年国产超节点市场空间 3414 亿元,2026-2028 CAGR 194%- Scale-up 协议:NVLink 封闭 vs 以太网(UALink/SUE/EthLink/OISA)开放双轨
三、国内"拼多卡"路线 vs 国外"单卡高性能"路线
3.1 两条路线的本质
| 维度 | 国外(英伟达)路线 | 国内(华为等)路线 |
|---|---|---|
| 单卡策略 | 单卡性能极致(B300 288GB/超高带宽/NVLink 1.8TB/s) | 单卡性能落后(制程/架构代差约 2 年) |
| 超节点策略 | NVL72 单柜72 GPU 紧密耦合 | 超大超节点多卡互联(4096/8192 卡) |
| 核心思想 | 用顶级单卡 + 高度成熟互联做"少而强" | 用多卡 Scale-up 集群补齐单卡差距 |
| 软件栈 | CUDA(成熟护城河) | CANN/MindSpore、TileLang |
| 等效算力 | 1 张 GB300 | 约 4 张华为卡(硬件代差) |
| 代表 | GB200/GB300 NVL72/NVL576 | Atlas 900/950/960 |
3.2 华为"拼多卡"的底层逻辑(梁文锋论断)
- 核心论断:"集群方案可以补齐单卡差距""所有 GB300 能做的任务,华为超节点都能做,延迟都一样"
- 做法:把原本分散在多台服务器的 AI 芯片,组成数百甚至数千卡的系统,提高芯片间互联效率、降低性能损耗
- 实证:华为 4096 卡超节点,若以 4096 卡为基本单元组 10 万卡集群,相比约 1.25 万台传统 8 卡服务器集群,MFU(模型算力利用率)差距达约 2.75 倍
- 为什么被逼走这条路线:受出口管制,2025 下半年后无合规途径的先进英伟达芯片进中国;华为只能靠"多卡互联 × 超大 Scale-up 域"弥补单卡代差
- 已跑通:DeepSeek V4 已实现纯昇腾训练;国产 AI 芯片 2025 年出货 41%(160 万张),华为 81.2 万张领跑
3.3 两条路线各自的优劣
| 对比项 | 英伟达(单卡强) | 华为(拼多卡) |
|---|---|---|
| 单卡性能 | ✅ 顶级(代差-2 年) | ❌ 落后约 2 年 |
| 互联带宽 | ✅ NVLink 5 1.8TB/s | ⚠️ 自研 HCCS(实测待验证) |
| 软件生态 | ✅ CUDA 最成熟 | ❌ CANN/MindSpore 成熟度差距明显 |
| 规模上限 | NVL72(576 单系统,规划中) | ✅ 4096/8192 卡,超大 Scale-up |
| 可用性/合规 | ❌ 受限不可购/供应不足 | ✅ 国产自主可控、供应充足 |
| 成本/溢价 | — | ⚠️ 华为卡溢价 50%-200% |
| 单位集群 MFU | 高 | ✅ 4096 卡组集群 MFU 高 2.75 倍 |
结论: - 英伟达赢在单卡 + 生态;华为赢在规模 + 自主可控 + 集群 MFU- "拼多卡"不是劣势妥协,而是在单卡受限下的系统性工程选择——用超大 Scale-up 域弥补单体差距,本质是把"硬件差距"转化为"拓扑/调度优势"
四、为什么有这些 / 如何想到的 / 核心解决什么问题
4.1 "怎么想到"的逻辑链
① 从 8 到 72:突破 NVLink 域的"带宽天花板"- 问题:8 卡 Scale-up 域,训练千亿参数模型需跨域通信(走 InfiniBand,比 NVLink 慢 36 倍)→ 通信瓶颈 - 解法:NVSwitch 5 把 NVLink 域扩到 72 卡,让更多模型参数"住"在同一个高速域内 → 减少跨域流量
② 为什么是 72:与 MoE 模型并行深度耦合- 问题:MoE 专家并行(EP=64)需要大量 GPU 同域互联,EP 内通信延迟敏感 - 解法:72 卡形成高带宽 NVLink 域,正好匹配 EP=64 的专家规模 → 推理/训练吞吐显著提升
③ 576 = 8×72:Scale-up 域级联- 问题:单机柜装不下再多 GPU(供电/散热物理极限) - 解法:72 卡为"原子单元",用 NVLink 光互联把 8 个柜级联成 576 卡统一域 → "单柜算力"走向"集群级基础设施"
④ 国内"拼多卡":出口管制下的"以多补单"- 问题:先进单卡不可获得/受限 → 单卡性能无法与英伟达比 - 解法:不拼单卡拼"Scale-up 域规模",用 4096/8192 卡超大超节点 + 高 MFU 调度补足 → "我卡少不强,但我节点大、调度好"
4.2 核心解决什么问题
| 问题 | 解法 |
|---|---|
| 跨 NVLink 域通信带宽瓶颈 | NVL72 扩 Scale-up 域至 72 卡 |
| MoE 专家并行通信延迟 | 72 卡同域 + EP=64 匹配 |
| 单机柜物理装不下更多 GPU | 72 卡原子单元 → 576(8 柜)光级联 |
| 单卡性能不足(国产) | 超大超节点(4096/8192)多卡互联补齐 |
| 模型利用率低下 | 4096 卡超节点组集群 → MFU 提升 2.75 倍 |
4.3 命名数字的战略意义
- 72/576:英伟达"原子单元级联"哲学的具象化(72→144→576)
- 384/512/640/1024/4096:各厂商差异化的"超节点原子单元"规模,形成产品矩阵
- 这些数字不是随手定的,而是硬件物理极限 × 模型并行需求 × 机柜工程三者博弈后的最优解
五、参考来源
- NVIDIA 官方博客:GB200 NVL72 与 Dynamo 提升 MoE 推理性能(NVLink 域从 8 卡扩至 72 卡、1.8TB/s、EP=64、比 400G 以太快 36×)
- 博客园/DevPress:GB200 NVL72 架构深度解析(Grace-Blackwell 超级芯片、36×2=72、NVSwitch 5、统一内存 5.76TB)
- 中兴通讯超节点白皮书(NVLink 光互联扩展至 576 卡集群超节点、NVL72 内 130TB/s、NVL36/NVL72)
- 艾媒网/环球网:华为 Atlas 950 超节点真机(单柜 64 卡起步、最多 8192 卡、对比 NVL144 卡规模 56.8×/互联带宽 62×/内存 15×,对比 NVL576 领先)
- 《财经》客户端:华为昇腾 960 集群 4096 卡、950 系列 1024 卡、MFU 2.75×、昇腾 910C/950DT/950PR 主流出货
- 新浪/东吴证券:国产超节点产品全景(华为灵衢/中科曙光 scaleX640 640/1280/阿里磐久 128/浪潮元脑 SD200)、趋势从单柜走向集群级
- 技术栈:华为昇腾 950 vs 英伟达 GB300 对比(4 华为卡:1 GB300、单卡代差约 2 年、CANN vs CUDA、梁文锋"集群补齐单卡差距")
- ZAKER/21 世纪经济报道:梁文锋"5 万张 GB300 或 20 万张国产卡""四张华为卡顶一张英伟达""DeepSeek V4 纯昇腾训练"/国产卡出货 41%
- 证券之星/东吴:国产超节点量产元年(中国移动 20 亿+ 集采、UALink/SUE/以太网 vs NVLink)
- 未来智库/华泰:2028 国产超节点市场 3414 亿元、CAGR 194%、超节点推动整柜系统交付
本文作为笔者个人备忘的文章,不喜勿喷。以及 AI 生成。