一、智算网络场景
- 业务负载说明
- 训练场景:大模型训练需要频繁的XPU间数据交换,数据移动成为系统瓶颈,训练过程易被“通信墙”制约。训练并行技术包括张量并行、序列并行、专家并行、流水线并行和数据并行,其中专家并行带来的通信量占比最大。
- 推理场景:推理场景与训练相似,但通信负载的差异化主要体现在部署策略上。PD分离和AE分离是两种主要的推理部署技术,通过解耦计算特征不同的阶段,避免资源竞争,最大化硬件利用率。
- 负载样例:不同并行技术产生的数据流量存在显著差异,专家并行占据总通信量中的绝对多数,网络带宽供给的架构设计需优先采用分层优化策略。
- 三种网络类型
- Front-End网络(VPC网络):连接所有计算节点与外部世界,负责大规模数据进出,特点:超大规模、较高延迟容忍、支持多租户、带宽达100Gb/s。
- Scale-Out网络(SO网络):用于互联多台XPU服务器,支持分布式训练、推理任务的节点间协作,特点:超低延迟、高带宽、中等规模、支持数十租户。
- Scale-Up网络(SU网络):专注于XPU间的超高速互连,特点:极致低延迟、超高带宽、多链路、通常单租户、规模通常在一个机架或多个机架范围。
二、现有组网架构讨论
- SO网络架构
- 胖树拓扑:业界主流的SO网络拓扑,通过叠加网络层次,可以持续扩大DCN网络规模,但组网成本高。
- 款型选择:框式设备端口数多,成本高;盒式设备端口数少,成本低。
- 收敛比设计:收敛比的设计取决于业务负载,业界通常选择在成本可接受范围内最低的收敛比,甚至是不收敛。
- 可靠性设计:电接入与光接入、单归接入与双归接入都是提升可靠性的方法。
- 轨道优化设计:多轨组网有利于稠密模型,但伴随模型稀疏化趋势,单轨组网将成为主流。
- Dragonfly拓扑:通过交换机间的直连替换交换机层次堆叠,实现组网规模的扩展,具有相对较好的对称性、可模组性、成本、普适性。
- Dragonfly+拓扑:在Dragonfly拓扑基础上,交换机组内交换机的互联关系为两层胖树,具有更强的可扩展性,可实现组内通信性能无损。
- SU网络架构
- 胖树拓扑:英伟达NVL72超节点采用1层胖树架构,NVL576SuperPOD采用2层Clos拓扑实现576个B200GPU互联,但高成本光互联成为阻碍客户接受的主要原因。
- Torus拓扑:谷歌TPU集群采用Torus拓扑,结合OCS实现灵活拓扑切分,但All-to-All通信和小通信域切分时存在带宽损失。
- Mesh类拓扑:AMD的SU网络架构采用InfinityFabric互联,为Mesh类拓扑,具有更低直径,更优的All-to-All性能。
三、扁平化智算网络架构优化方向
- SO网络
- 多平面胖树拓扑:通过扩展平面方式,满足接入端口的带宽需求,可实现两层十万卡集群组网,但需要解决X1模式MAC、硬件和布线、多平面负载均衡和多平面故障隔离等问题。
- Group-WiseDragonfly+:在Dragonfly+组网中,每个交换组内的多个L2交换机所有端口与其他组采用1D-FullMesh连接,具备Dragonfly+的全部优点,但组网规模变小。
- SU网络
- 一层全光互连:ETH-XUltra项目提出单级光互联架构,实现256/512卡超节点,控制网络成本,实现计算与网络的解耦,但需要解决可靠性、端侧模式、光互连功耗和时延等问题。
四、未来网络架构趋势展望
- 大规模低直径的网络
- BalancedSparseTree(BST):一种平衡稀疏树,基于组合理论设计的稀疏互联替代全互联,实现组网规模扩张,但减少了等价路径数量。
- SlimFly:基于图论中性质较好的MMS图进行构造得到,具有成本更低、性能接近Clos等优点,但组网的连线较为复杂,适配该拓扑的集合通信算法还有待完善。
- 多网融合:如果能实现多种网络类型的合一,包括协议的合一、物理的合一,TCO将进一步下降,但需要突破TCP、RDMA、LD/ST多业务性能隔离难题。