超节点服务器发展趋势及国产方案分析
超节点服务器发展趋势
- 算力系统发展方向:从传统的 Scale-out(增加节点数量)转向 Scale-up(增强单个节点性能),以满足大模型对数据传输和计算协同效率的需求。
- 超节点核心目标:通过高性能的 Scale-up 互连,让多颗 GPU 在软件层面呈现为单一超级 CPU,实现更直接内存访问,降低延迟,提升带宽。
- 英伟达超节点演进路径:
- Hooper 时代:以大模型训练为主,奠定 AI 服务器基础架构,提升 HBM 容量和带宽。
- Blackwell 时代:转向推理效率,推出 NVLink Scale-up 方案,将 72 颗 GPU 集成到 NVLink Scale-up 域,实现低延迟、高带宽的集群计算。
- Robin 时代:进一步强化多裸片、HBM 和自研 CPU,推动 IO 解耦,提升单封装功耗,并采用垂直刀片和资源池解耦设计。
国产超节点方案分析
- 协议选择:
- 闭源协议:如 NVLink、领航、HiLink 等,优势在于软硬件深度协同,性能可控,但生态封闭。
- PCIe 和以太网:优势在于开发门槛低,传输效率高,生态开放,但大规模拓展时存在功耗、扩展性和兼容性挑战。
- 国产方案代表:
- 华为:采用两层领航互联,正交架构,跨机柜光互联,实现 384 颗 NPU 的高性能协同,适用于大模型推理。
- 海光、曙光:采用高密度正交架构、刀片设计、浸没式液冷和高压直流供电,将国产卡快速转化为可部署的算力产品。
- 中兴、阿里:采用无背板正交结构,缩短信号路径,提升部署效率,并实现 CPU 和 GPU 的模块化分离,适配多元 AI 芯片。
研究结论
- 超节点发展趋势:铜缆连接向 PCB 背板演进,托盘向刀片演进,电源和冷却向外置资源池演进。
- 国产超节点竞争焦点:从单卡对标转向整机系统和业务效率对标,通过系统化工程弥补芯片差距,实现大规模超节点的经济可行性。
- 核心关注环节:
- 服务器:受益于下游资本开支上行和超节点利润率提升,关注浪潮信息、中科曙光、华清技术等。
- 交换芯片:国产替代和增量市场机会并存,关注 51.2T 及更高速率产品成熟。
- 连接:超节点规模扩大带来高速铜缆和连接器的需求增长,关注链路数量、速率和可靠性提升。