NVIDIA DGX SuperPOD为基于Rubin的系统奠定基础,整合了NVIDIA在计算、网络和软件领域的最新突破,与NVIDIA Blackwell平台相比,可将推理token成本降低多达10倍,加速各类AI工作负载。Rubin平台由六款全新芯片组成,包括NVIDIA Vera CPU、Rubin GPU、NVLink 6 Switch、ConnectX-9 SuperNIC、BlueField-4 DPU和Spectrum-6 Ethernet Switch,通过先进的协同设计方法加速训练并降低推理成本。
核心技术进步
- 第六代NVIDIA NVLink:每块GPU 3.6TB/s、每个Vera Rubin NVL72机架260TB/s,专为大规模MoE和长上下文工作负载打造。
- NVIDIA Vera CPU:88个NVIDIA自定义Olympus核心,完全兼容Armv9.2,具备超高速NVLink-C2C互连,支持行业领先的AI工厂计算。
- NVIDIA Rubin GPU:50拍浮点的NVFP4 AI推理算力,配备第三代Transformer Engine,支持硬件加速压缩。
- 第三代NVIDIA机密计算:Vera Rubin NVL72是首个在机架级别提供NVIDIA机密计算的平台,可在CPU、GPU和NVLink域之间保持数据安全。
- 第二代RAS引擎:覆盖GPU、CPU和NVLink,提供实时健康监测、容错能力和主动维护,通过模块化无缆托盘实现3倍 faster servicing。
DGX SuperPOD部署
- DGX Vera Rubin NVL72:整合8套系统,576颗Rubin GPU,提供28.8 exaflops的FP4性能和600TB高速内存,实现机架范围内的统一内存与计算空间。
- DGX Rubin NVL8:提供64台系统,512颗Rubin GPU,采用液冷形态和x86 CPU,与Blackwell系统相比性能提升5.5倍。
网络技术
- NVIDIA Quantum-X800 InfiniBand:业界最低时延和最高性能,利用SHARP v4和自适应路由将集合通信操作卸载到网络。
- NVIDIA Spectrum-X Ethernet:基于Spectrum-6以太网交换机和ConnectX-9 SuperNIC,提供可预测的高性能横向扩展和跨域连接,针对AI工作负载的“东西向”流量模式进行优化。
软件支持
- NVIDIA Mission Control:支持Rubin-based DGX系统,实现基础设施管理与运营的自动化,加速基础设施运营的各个环节,提升冷却和供电事件的控制,并最大化AI工厂生产力。
- NVIDIA AI Enterprise:支持NVIDIA NIM微服务,如NVIDIA Nemotron-3开放模型家族的数据和库。
未来展望
DGX SuperPOD将成为新一代AI工厂的发射台,帮助组织构建前沿模型、多模态系统以及代理式AI应用。搭载DGX Vera Rubin NVL72或DGX Rubin NVL8系统的NVIDIA DGX SuperPOD将于今年下半年上市。