智能算力需求与新型智算中心
智能算力需求增长
- AI模型迭代与数量增长:AI模型的能力提升依赖于更大规模的训练数据和参数量,这导致了更高的算力需求。同时,AI模型种类的多样化和各厂商自主模型的研发,进一步推动了算力需求的增长。
- AI应用爆发:随着AI应用的普及,用户数量的爆发促使推理侧的算力需求迅速增长。
智算中心发展
- 从集群到超级池化:随着AI大模型参数量的增长,新型智算中心开始从传统的集群架构向超级池化阶段转变。这一阶段强调了对设备形态、互联方案、存储、平台、散热等方面的全面升级要求。
网络互联方案
- 节点内互联:节点内互联方案包括英伟达的NVLink和开放式技术方案如OAM与UBB。NVLink已经发展至第五代产品,支持高达576个GPU之间的无缝高速通信。
- 节点间互联:节点间互联主要采用InfiniBand和RoCEv2技术。InfiniBand在网络性能、集群规模、运维等方面展现出显著优势,而RoCEv2则提供了分布式网络的灵活性。
投资建议与风险提示
- 投资建议:AI大模型的快速发展对数据中心的计算、存储、网络提出了新的挑战,新型智算中心成为发展趋势。考虑到AI大模型需要部署在高速互联的多个AI芯片上,建议关注宝信软件等企业。
- 风险提示:宏观经济波动、下游需求不足、AI伦理风险等均为潜在风险。
智算中心的技术演进与网络互联
智算中心技术体系
- 以GPU为核心:智算中心是以GPU、AI加速卡等智能算力为核心,集约化的新型数据中心。
- “三层两域”架构:包括基础设施层、智算平台层和应用使能层,以及智算运维域和智算运营域。
网络互联的演变
- 从集群到超级池化:智算中心的网络互联经历了从节点内互联到节点间互联的演进,适应了AI大模型的算力需求。
- 互联方案:节点内互联采用NVLink或开放式技术方案,节点间互联则倾向于InfiniBand或RoCEv2技术。
模型训练中的网络瓶颈与解决方案
分布式并行运算的重要性
- 分布式并行运算:AI大模型需要在高速互联的多个AI芯片上进行分布式并行运算,以应对巨量的数据和模型参数。
网络成为瓶颈的原因
- 通信需求:随着模型参数量的增长,卡间通信需求增加,成为制约AI算力瓶颈。
解决方案:互联协议与技术
- NVLink与OAM/UBB:NVLink已发展至第五代,支持更高带宽和更多链接数。OAM和UBB方案则提供了统一的扣卡模组形态和基板拓扑结构,支持高速互联。
- InfiniBand与RoCEv2:InfiniBand在无损数据传输和大规模集群支持上表现优异,而RoCEv2则提供了一种分布式网络解决方案。
结论
通过深度分析AI大模型的需求、智算中心的技术发展以及网络互联方案,可以看出AI技术的快速发展对数据中心提出了前所未有的挑战,同时也带来了巨大的发展机遇。新型智算中心的建设和网络互联技术的优化将是未来发展的关键。