智算中心网络协议演进与思考
1. 行业背景与需求驱动
- AI需求激增:随着AI基础设施建设的不断布局,算力与网络成为支撑AI算力的两大关键基础设施。
- 算力与网络基础设施:GPU作为算力的核心,其市场规模的扩大直接推动了对网络设备的需求增长。
2. 算网基础设施的关键趋势
- 算力需求激增:AI智能计算需求持续增长,促使算网基础设施不断布局,尤其是GPU市场的扩张。
- GPU与网络设备需求:GPU集群的广泛使用引发对网络设备的大量需求,网络发展前景明朗。
3. 智算中心的流量特性与挑战
- 流量模型差异:传统数据中心与智算中心的流量模型存在显著差异,包括流量数量、带宽、同步性等方面的变化。
- AI模型部署挑战:AI大模型训练过程中,网络成为算力瓶颈,主要原因是GPU集群间的通信消耗大,网络性能直接影响算力加速比。
4. 高性能网络协议的现状与比较
- IB与RoCE:InfiniBand和RoCE是当前主流的高性能网络协议,分别侧重于硬件级低时延和以太网的无损性,二者在路由、转发机制上有所不同。
- 性能差异:IB在传输层提供硬件级保障,而RoCE依赖于网络设备和网卡实现无损性,两者在性能上有各自的优势和局限。
5. 现存问题与创新方向
- RoCE的挑战:RoCE网络在部署大AI模型时存在诸多问题,包括有效通信带宽不足、拥塞导致的时延和抖动增加。
- 解决方案探索:AWS通过革新SRD协议和优化网络架构,以及博通的DDC架构,旨在解决上述问题,通过改进报文处理和调度机制,提升网络效率。
6. 面向未来的智算中心网络标准与技术体系
- GSE技术体系:GSE(全调度以太网)技术体系致力于解决智算中心网络中的带宽、时延、可靠性等问题,通过优化物理层、链路层、网络层和传输层,构建标准开放的架构。
- 标准化与合作:中国移动、中国信息通信研究院以及多家企业、机构共同发起GSE推进计划,推动技术标准和产业生态的成熟。
7. 智能网络技术的展望
- GSE技术体系的推进:物理层、链路层、网络层和传输层的优化,以及管理和运维体系的增强,共同构建起高速、无损的智算中心网络。
- 可靠性与性能提升:通过引入NDMA(新型多播协议)和改进网络可靠性机制,提升智算中心网络的稳定性和效率。
结论
智算中心网络的演进与优化是支撑AI大模型训练的关键,通过全调度以太网等技术体系的创新与标准化工作,有望解决当前面临的带宽、时延、可靠性等挑战,推动AI技术的发展与应用。