☰
超节点 GPU 数量为什么是 8、72、128、144、576?——数字背后的工程逻辑、行业主流超节点盘点、国内“拼多卡”vs 国外“单卡高性能”路线之争
2026/10/6 8:02:45 网站建设 项目流程

超节点 GPU 数量为什么是 8、72、128、144、576?——数字背后的工程逻辑、行业主流超节点盘点、国内"拼多卡"vs 国外"单卡高性能"路线之争

本文作为笔者个人备忘的文章,不喜勿喷。以及 AI 生成。不构成投资建议。本文基于 NVIDIA 官方博客(GB200 NVL72 与 Dynamo)、中兴通讯超节点白皮书、东吴/华泰/国泰君安等券商研报、环球网/艾媒/新浪(华为 Atlas 950 真机、NVL144/NVL576 对标)、《财经》客户端(昇腾 960/4096 卡)、证券之星(国产超节点量产元年)、CSDN/博客园(GB200 NVL72 架构)等公开资料,系统性回答"为什么超节点 GPU 数量常是 8、72、128、144、576(尤其 72 的倍数)"、盘点行业主流超节点,并深度对比国内"拼多卡"路线 vs 国外"单卡高性能"路线。

一、这些数字的来历:从 8 到 72 到 576 的工程进化

1.18:第一代 Scale-up 域的上限

阶段GPU 数量来源
HGX H100/H200(第 1/2/3/4 代 NVLink)8 卡单个 NVLink 域最多连接8 个 GPU(900GB/s),即 DGX/HGX 8 卡标准
PCIe 时代4-8 卡PCIe 总线带宽有限

为什么是 8: - 早期 NVLink 通过NVSwitch实现全互联,受交换芯片端口数、板卡供电、机箱散热限制 - 8 卡是"成本 × 带宽 × 密度"的工程平衡点(8×80GB=640GB 显存、可装下 70B 模型) - 是后来所有超节点数量的"基本单元"

1.272:NVL72 的里程碑——为什么不是 64/80/96?

NVIDIA 在 GB200 时代将单个 Scale-up(NVLink 域)从 8 卡跃升至72 卡。

维度NVL72 关键结构
基本单元GB200 Superchip = 1 个 Grace CPU + 2 个 Blackwell GPU(NVLink-C2C 900GB/s)
机柜组成36 个 Superchip × 2 GPU = 72 GPU,或 18 计算托盘 × 4 GPU
互联第 5 代 NVSwitch,单卡 NVLink 1.8 TB/s,GPU 间总带宽130 TB/s
统一内存72 GPU 共享统一内存空间(72×80GB ≈ 5.76TB)
设计目标专为 MoE 模型(EP=64 专家并行)与 Llama 70B 等稠密模型服务

72 的数学/工程根源: -72 = 2³ × 3²,因数丰富,易做拓扑切分(可分 2/3/4/6/8/9/12/18/24/36/72) -由超芯片结构决定:36 个 Grace-Blackwell(每芯片 2 GPU)→ 36×2 = 72,是"超级芯片 ×2"的自然结果 -受单机柜物理限制:供电(~120kW+)、液冷散热、NVSwitch 端口数决定一柜只能容纳约 72 GPU - 72 正好承载MoE EP=64(专家并行 64)所需的 GPU 规模,与模型并行需求强耦合

1.3144、576:72 的倍数=Scale-up 域级联

数字组成含义
NVL3618 超芯片 × 2半柜/入门超节点
NVL7236 超芯片 × 2标准单柜超节点
NVL1442 × 72双柜级超节点(英伟达新一代对标基准)
NVL5768 × 72 = 5768 个机柜 × 72 GPU 纳入同一高速互联系统(英伟达2027 年 Rubin Ultra计划,NVLink 光互联)

关键规律:576 = 8 × 72、144 = 2 × 72——超节点数字都是"以 72 为基数、按柜数或域数级联",因为 Scale-up 域以 72 GPU(NVL72)为一个"原子单元",多域堆叠成更大超节点。中兴白皮书确认:英伟达通过 NVLink 光互联扩展至576 卡集群超节点。

1.4 其他主流数字:128/384/512/640/1024/4096

数字厂商/产品说明
128阿里磐久AL128云侧资源池化、单级交换重构超节点
384华为Atlas 900 A3早期国产超节点
512阿里 UPN512单层光互联 512 xPU Scale-up 网络
640 / 1280中科曙光scaleX640单机柜 640 卡、双柜 1280 卡,算力 600+ PFLOPs
1024华为 950 系列上一代超节点集群
4096华为昇腾 960新一代超节点集群规模 4096 卡
8192 / 15488华为 Atlas 950/960单系统最多互联卡片数

国内数字(128/384/512/640)源于各厂商自研"超节点原子单元"规模;华为走"超大超节点"(千卡级 Scale-up 域),英伟达走"72 卡原子单元逐柜级联"。

二、行业主流超节点全景盘点(2025-2026)

阵营厂商超节点GPU 数关键特性
海外英伟达GB200/GB300NVL7272NVLink 5、1.8TB/s、MoE 优化
英伟达NVL576(规划 2027)576Rubin Ultra、8 柜光互联
AMDHelios72MI455X + UALoE、对标 NVL72
国内华为Atlas 900 A3384自研 HCCS/灵衢 UB
华为Atlas 950/9601024→4096/8192业界最大规模商用超节点
中科曙光scaleX640640/1280高密架构+浸没液冷、开放
阿里磐久AL128/UPN512128/512云资源池化、单级交换
字节跳动EthLink—以太网 Scale-up 协议
腾讯ETH-X—以太网 Scale-up
浪潮元脑SD200—高密定制

趋势(东吴/华泰): - 中国移动 2026-2027 超节点集采20 亿+- 华泰测算2028 年国产超节点市场空间 3414 亿元,2026-2028 CAGR 194%- Scale-up 协议:NVLink 封闭 vs 以太网(UALink/SUE/EthLink/OISA)开放双轨

三、国内"拼多卡"路线 vs 国外"单卡高性能"路线

3.1 两条路线的本质

维度国外(英伟达)路线国内(华为等)路线
单卡策略单卡性能极致(B300 288GB/超高带宽/NVLink 1.8TB/s)单卡性能落后(制程/架构代差约 2 年)
超节点策略NVL72 单柜72 GPU 紧密耦合超大超节点多卡互联(4096/8192 卡)
核心思想用顶级单卡 + 高度成熟互联做"少而强"用多卡 Scale-up 集群补齐单卡差距
软件栈CUDA(成熟护城河)CANN/MindSpore、TileLang
等效算力1 张 GB300约 4 张华为卡(硬件代差)
代表GB200/GB300 NVL72/NVL576Atlas 900/950/960

3.2 华为"拼多卡"的底层逻辑(梁文锋论断)

  • 核心论断:"集群方案可以补齐单卡差距""所有 GB300 能做的任务,华为超节点都能做,延迟都一样"
  • 做法:把原本分散在多台服务器的 AI 芯片,组成数百甚至数千卡的系统,提高芯片间互联效率、降低性能损耗
  • 实证:华为 4096 卡超节点,若以 4096 卡为基本单元组 10 万卡集群,相比约 1.25 万台传统 8 卡服务器集群,MFU(模型算力利用率)差距达约 2.75 倍
  • 为什么被逼走这条路线:受出口管制,2025 下半年后无合规途径的先进英伟达芯片进中国;华为只能靠"多卡互联 × 超大 Scale-up 域"弥补单卡代差
  • 已跑通:DeepSeek V4 已实现纯昇腾训练;国产 AI 芯片 2025 年出货 41%(160 万张),华为 81.2 万张领跑

3.3 两条路线各自的优劣

对比项英伟达(单卡强)华为(拼多卡)
单卡性能✅ 顶级(代差-2 年)❌ 落后约 2 年
互联带宽✅ NVLink 5 1.8TB/s⚠️ 自研 HCCS(实测待验证)
软件生态✅ CUDA 最成熟❌ CANN/MindSpore 成熟度差距明显
规模上限NVL72(576 单系统,规划中)✅ 4096/8192 卡,超大 Scale-up
可用性/合规❌ 受限不可购/供应不足✅ 国产自主可控、供应充足
成本/溢价—⚠️ 华为卡溢价 50%-200%
单位集群 MFU高✅ 4096 卡组集群 MFU 高 2.75 倍

结论: - 英伟达赢在单卡 + 生态;华为赢在规模 + 自主可控 + 集群 MFU- "拼多卡"不是劣势妥协,而是在单卡受限下的系统性工程选择——用超大 Scale-up 域弥补单体差距,本质是把"硬件差距"转化为"拓扑/调度优势"

四、为什么有这些 / 如何想到的 / 核心解决什么问题

4.1 "怎么想到"的逻辑链

① 从 8 到 72:突破 NVLink 域的"带宽天花板"- 问题:8 卡 Scale-up 域,训练千亿参数模型需跨域通信(走 InfiniBand,比 NVLink 慢 36 倍)→ 通信瓶颈 - 解法:NVSwitch 5 把 NVLink 域扩到 72 卡,让更多模型参数"住"在同一个高速域内 → 减少跨域流量

② 为什么是 72:与 MoE 模型并行深度耦合- 问题:MoE 专家并行(EP=64)需要大量 GPU 同域互联,EP 内通信延迟敏感 - 解法:72 卡形成高带宽 NVLink 域,正好匹配 EP=64 的专家规模 → 推理/训练吞吐显著提升

③ 576 = 8×72:Scale-up 域级联- 问题:单机柜装不下再多 GPU(供电/散热物理极限) - 解法:72 卡为"原子单元",用 NVLink 光互联把 8 个柜级联成 576 卡统一域 → "单柜算力"走向"集群级基础设施"

④ 国内"拼多卡":出口管制下的"以多补单"- 问题:先进单卡不可获得/受限 → 单卡性能无法与英伟达比 - 解法:不拼单卡拼"Scale-up 域规模",用 4096/8192 卡超大超节点 + 高 MFU 调度补足 → "我卡少不强,但我节点大、调度好"

4.2 核心解决什么问题

问题解法
跨 NVLink 域通信带宽瓶颈NVL72 扩 Scale-up 域至 72 卡
MoE 专家并行通信延迟72 卡同域 + EP=64 匹配
单机柜物理装不下更多 GPU72 卡原子单元 → 576(8 柜)光级联
单卡性能不足(国产)超大超节点(4096/8192)多卡互联补齐
模型利用率低下4096 卡超节点组集群 → MFU 提升 2.75 倍

4.3 命名数字的战略意义

  • 72/576:英伟达"原子单元级联"哲学的具象化(72→144→576)
  • 384/512/640/1024/4096:各厂商差异化的"超节点原子单元"规模,形成产品矩阵
  • 这些数字不是随手定的,而是硬件物理极限 × 模型并行需求 × 机柜工程三者博弈后的最优解

五、参考来源

  • NVIDIA 官方博客:GB200 NVL72 与 Dynamo 提升 MoE 推理性能(NVLink 域从 8 卡扩至 72 卡、1.8TB/s、EP=64、比 400G 以太快 36×)
  • 博客园/DevPress:GB200 NVL72 架构深度解析(Grace-Blackwell 超级芯片、36×2=72、NVSwitch 5、统一内存 5.76TB)
  • 中兴通讯超节点白皮书(NVLink 光互联扩展至 576 卡集群超节点、NVL72 内 130TB/s、NVL36/NVL72)
  • 艾媒网/环球网:华为 Atlas 950 超节点真机(单柜 64 卡起步、最多 8192 卡、对比 NVL144 卡规模 56.8×/互联带宽 62×/内存 15×,对比 NVL576 领先)
  • 《财经》客户端:华为昇腾 960 集群 4096 卡、950 系列 1024 卡、MFU 2.75×、昇腾 910C/950DT/950PR 主流出货
  • 新浪/东吴证券:国产超节点产品全景(华为灵衢/中科曙光 scaleX640 640/1280/阿里磐久 128/浪潮元脑 SD200)、趋势从单柜走向集群级
  • 技术栈:华为昇腾 950 vs 英伟达 GB300 对比(4 华为卡:1 GB300、单卡代差约 2 年、CANN vs CUDA、梁文锋"集群补齐单卡差距")
  • ZAKER/21 世纪经济报道:梁文锋"5 万张 GB300 或 20 万张国产卡""四张华为卡顶一张英伟达""DeepSeek V4 纯昇腾训练"/国产卡出货 41%
  • 证券之星/东吴:国产超节点量产元年(中国移动 20 亿+ 集采、UALink/SUE/以太网 vs NVLink)
  • 未来智库/华泰:2028 国产超节点市场 3414 亿元、CAGR 194%、超节点推动整柜系统交付

本文作为笔者个人备忘的文章,不喜勿喷。以及 AI 生成。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询