NVIDIA Rubin GPU技术详解:224个SM、288GB HBM4与NVLink 6
2026/7/23 11:40:40 网站建设 项目流程

NVIDIA于2026年7月21日公开Rubin GPU进一步架构细节。本次披露覆盖芯片组织、Tensor Core与Transformer Engine、HBM4、TMA、注意力执行、Kernel依赖、NVLink通信和机架功率管理。本文只整理已公开技术事实,并说明各项机制对应的负载。

1.Rubin GPU规格总览

子系统

规格

封装

双计算裸片,通过NV-HBI连接

晶体管

3360亿

计算单元

224个SM、896个Tensor Core

Transformer Engine

第三代,支持NVFP4等精度

NVFP4推理

最高50 PFLOPS;预备峰值,官方未标注Dense

显存

最高288GB HBM4,12-Hi堆叠

显存带宽

最高22TB/s

Scale-up

NVLink 6最高3.6TB/s双向总带宽

CPU—GPU

NVLink-C2C最高1.8TB/s双向一致性带宽

Host I/O

PCIe 6.0代际x16:单向约128GB/s、双向合计约256GB/s

口径说明|50 PFLOPS是NVIDIA公布的NVFP4预备峰值规格。官方规格表没有将该项标注为Dense specification,而NVFP4训练35 PFLOPS带有Dense脚注,因此不宜自行写死为稠密或含稀疏性,也不应与不同精度或平台层级的数据直接比较。

2.双裸片与计算组织

Rubin采用两个reticle-limited计算裸片,通过NV-HBI在封装内统一。GPU内部以GPC组织SM,使用集中式L2缓存;GigaThread Engine负责工作调度,MIG Control用于多工作负载分区,NV-DEC承担视频解码。

第三代Transformer Engine根据数值格式调度Tensor Core。Rubin把Tensor Core每时钟处理的K维数据量提高一倍。对于输出维度被Tensor Parallel切小、K维仍较大的GEMM,可用更少的K循环完成归约,减少循环和指令开销。

3.TMA的内联描述符更新

TMA负责Tensor在显存与共享内存之间的地址计算和数据传输。MoE模型包含多个布局相同、位置不同的专家权重。此前软件可能为不同专家维护不同描述符;Rubin支持在TMA指令中内联覆盖内存指针、stride等字段,使多个专家共享基础描述符。

该机制降低的是描述符管理与地址更新开销。实际收益受专家数量、专家并行策略、Tensor布局及框架实现影响,不能独立推导端到端加速比例。

4.长上下文注意力:激活稀疏与Softmax

Rubin仍先执行稠密QKᵀ计算,再把中间注意力分数转换成结构化2:4稀疏表示,同时生成非零值和元数据。Softmax可针对非零值运行,随后的attention×V可用稀疏MMA执行,外围接口仍输出稠密数据。

这一流程主要减少注意力中间结果的存储、读取与计算。Rubin还提高指数函数吞吐:相对Blackwell基线,FP32为2倍,BF16/FP16为4倍,用于缓解Softmax的指数和归约运算瓶颈。

5.依赖Kernel的细粒度触发

推理图中常见生产者—消费者Kernel链。若消费者必须等待大范围生产任务完成,GPU时间线上会出现空隙。Rubin允许依赖工作在所需Tile数据到达后更早启动,把触发粒度从批量依赖缩小到数据可用级别。

该机制主要改善Kernel切换和激活值依赖延迟,适合逐层、逐Token的执行路径。它与CUDA图、Kernel融合等软件优化互补,最终是否启用仍取决于框架和编译器支持。

6.HBM4:容量与带宽分别解决什么

Rubin最高配置为288GB HBM4、22TB/s。容量决定权重、上下文和KV Cache是否常驻;带宽决定Decode阶段每个Token访问权重和KV状态的速度。

NVIDIA称22TB/s相较Blackwell与Blackwell Ultra最高8TB/s约提升2.8倍。Rubin的容量与最高288GB的Blackwell Ultra相同,因此不能把升级简单描述为“显存更大”;更准确的变化是HBM4接口和控制器显著扩大数据吞吐。

7.NVLink 6与counted writes

NVLink 6为单颗Rubin GPU提供最高3.6TB/s双向Scale-up总带宽。Rubin进一步加入设备发起通信的counted writes,让接收GPU通过计数更直接地确认传输完成,减少屏障、确认消息与原子标志相关的同步步骤。

对Expert Parallel、Tensor Parallel和分布式Decode而言,带宽与同步开销都会影响通信计算重叠。NVLink 6解决数据通路,counted writes处理完成通知,两者不应混为同一指标。

8.从GPU扩展到NVL72

Vera Rubin NVL72集成72颗Rubin GPU、36颗Vera CPU、NVLink 6交换与机架级网络。NVIDIA同时公开45°C液冷、Intelligent Power Smoothing和DSX MaxLPS等设计,用于控制瞬态功率并提高固定供电预算内的GPU部署密度。

NVIDIA宣称DSX MaxLPS可在同等电力预算下配置最高多40%的GPU,这是平台级规划结果,取决于负载、功率曲线、运行点与设施条件,不是Rubin GPU自身能效倍数。

9.性能数据的正确使用方式

“最高10倍Agent吞吐/单位能耗”来自NVIDIA内部2T MoE工作负载,对比的是Vera Rubin与Blackwell平台的Pareto前沿。该结果包含GPU、CPU、内存、互连、软件和机架系统,不能改写为单卡或所有模型普遍提升10倍。

工程验证建议记录模型与活跃参数、精度、上下文、批量、并发、并行策略、TTFT、TPOT、Tokens/s、有效显存带宽、通信占比和整机功耗。只有在相同服务目标下,平台效率才有可比性。

10.总结

Rubin的架构重点可以归纳为三条数据路径:TMA管理GPU内部Tensor移动,HBM4提高权重与KV状态读取速度,NVLink 6与counted writes优化GPU间通信;Tensor Core、注意力稀疏和细粒度Kernel触发则提高这些数据到达后的执行效率。

截至2026年7月,NVIDIA已公布Vera Rubin进入全球量产爬坡和合作伙伴导入阶段。赋创将持续关注新一代GPU及服务器平台的技术演进,并将相关变化用于完善显存、互连、网络、供电散热和集群扩展等方案评估,为不同模型与业务负载提供更适配的AI算力配置参考。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询