英伟达近日对最新的 Rubin GPU 架构展开了深度技术拆解,全方位展示了其在多机架、多系统以及数据中心集群层面实现大规模算力的重大飞跃。作为英伟达加速计算演进史上的重要里程碑,该款 AI 加速器在稀疏 NVFP4 精度下能够爆发出高达 50 PetaFLOPS 的惊人算力。


在满血硬件配置下,Rubin GPU 内部集成了多达 224 个流式多处理器(SM)以及 288GB 的 HBM4 显存。依托高达 3360 亿个晶体管的庞大体量,英伟达还为其注入了搭载第三代 Transformer 引擎的 896 个 Tensor Core。为了彻底释放这股庞大的原始算力,英伟达将 GPU 算力资源科学划分至配有集中式 L2 缓存的图形处理器集群中,并配合 GigaThread 调度引擎来统筹工作流与优化资源利用率;此外,升级后的 MIG 弹性切分功能允许该 GPU 灵活拆分为多个虚拟 GPU,其运行机制基本对标现代 CPU 处理虚拟核心的模式。

在显存堆叠与架构配置方面,英伟达携手顶级内存巨头,通过 12 层堆叠 HBM4 模块实现了 288GB 的海量显存容量。配合专用的 HBM 控制器与 PHY 物理层,该芯片一举撕开了高达 22TB/s 的峰值显存带宽,在行业内树立了极强的竞争力。其张量内存管理器(TMM)迎来全面升级以陡增数据传输效率,而整个 GPU 的 Scale-up 纵向扩展与节点通信则由全新的 NVLink 6 总线全权接管。借助 NVLink 6,全互联 GPU 间的架构通信带宽飙升至 3600GB/s,同时 NVLink-C2C 板级互联技术实现了 1800GB/s 的 CPU 与 GPU 跨芯片通信带宽,英伟达甚至还额外集成了带宽达 256GB/s 的 PCIe Gen 6 交换模块以满足外部设备的高速数据交互。

纵向扩展拓扑通信一直是英伟达打压对手的核心壁垒,它能让 GPU 在机架级集群中与其他节点实现零瓶颈的高效协同。传统 GPU 间的数据交换往往极度依赖复杂的协调与同步机制,一旦系统因等待数据传输而卡顿,就会引发严重的延迟。针对于这一行业痛点,Rubin 架构首次引入了设备自发通信机制,允许单颗 GPU 独立管理数据传输流,直接省去了繁琐的外部优化环节并大幅拉低了传输时延。

这类顶级算力集群往往伴随着夸张的功耗表现,仅单台 NVL72 机架就密集挤下了 72 颗 GPU。针对全新 Vera Rubin NVL72 机柜系统,英伟达量身定制了智能功率平滑技术(Power Smoothing),将所有系统级硬件统统塞入单一的固定功耗包络线之内。比如在跑大型 AI 工作负载时,功耗往往会在等待 CPU 调度的空闲期与全核狂飙的 GPU 算力峰值之间剧烈波动;而通过智能功率平滑技术,Vera Rubin NVL72 系统的平均功耗相比上一代 Grace Blackwell NVL72 成功拉低了约 10%,50毫秒级别的峰值功耗更是直接削掉了近 20%,其整机功耗预算优化还得到了英伟达 DSX MaxLPS 技术的深度赋能。