一、背景与需求
AI大模型的快速发展导致算力需求激增,传统的网络架构面临挑战。业界开始探索分布式智算中心协同训练模式,以应对单中心算力受限问题,并提高资源使用效率。然而,传统网络设备+DWDM模式无法满足跨地域场景对超大带宽、超低时延、超高可靠性和超高安全性的要求,主要体现在组网成本高、带宽瓶颈、可靠性差、智算业务支持能力低、调制技术兼容性问题以及传输距离引入的安全性问题等方面。
二、智算集群互联的系统架构
智算集群互联技术旨在构建高效、智能、可靠的网络基础设施,满足智算业务需求。其设计目标包括构建超大规模算力底座、打造即插即用算力互联能力、支撑算力资源平滑演进、保证算力互联安全可靠以及算力互联绿色低碳环保。设计原则为高性能、高可靠、灵活扩展和智能管控。总体架构包括数据平面(智算中心互联网络设备、链路调度单元和光网络设备)和控制平面(链路管控单元和网络管控单元)。
三、关键技术
IP子系统关键技术包括物理层关键技术(弹性通道FlexLane、物理层安全PHYSec)、数据链路层关键技术(10T级聚合通道SuperPipe)、网络层关键技术(微流级精准流控MicroPFC、快速拥塞反馈FastCNP、增强等价路由功能、支持IPv6+的基础能力)、网络无损关键技术以及800GE/1.6TE关键技术。光子系统关键技术包括微光学模块、软件微服务化技术和ONM光导航矩阵——光交换技术应用。IP+光融合设计关键点包括成本及系统层级设计、兼容性与健壮性设计以及可靠性设计。
四、新设备形态
智算互联网络设备采用全模块化设计,支持多芯片组、高性能数据采集能力、业务无损切换、大容量高端口速率支持以及IP新协议支持。
五、组网及应用
典型组网拓扑包括点对点、星型和Full-Mesh。典型应用场景包括跨智算中心AI大模型分布式训练、跨智算中心资源整合场景、存算分离场景以及通算互联场景。
六、试点验证
中国移动完成业界首次800G以太网智算协同训练的现网技术试验,验证了IP与光融合GSE-DCI方案的有效性。
七、总结与展望
智算集群互联技术为解决算力需求与供给之间的不平衡以及算力资源分布不均问题提供了新的思路和途径。中国移动将继续在超大带宽、高可靠性等技术方向深入探索与研究,为“东数西算”工程提供坚实可靠的技术支撑。