AI/ML 数据中心网络验证评估 AI/ML 网络基础设施的概念、 挑战和解决方案
AI 正在重塑数据中心,其工作负载的规模和复杂性要求数据中心部署数千个 GPU 和 xPU,并运行在高速互连网络上。AI 工作负载需要低延迟、高吞吐量和无损通信,网络已成为 AI 基础设施的关键性能组件。
AI 工作负载的关键网络概念包括:
- 流量模式与集合通信库 (CCL):AI 工作负载依赖于独特的流量模式,专为分布式系统中的大容量并行数据处理而设计。集合通信库 (CCL) 是一个软件库,旨在促进并行和分布式计算环境中多个进程之间的高效数据交换和同步。
- 集合通信操作:包括 AllReduce(全归约)、RingAllReduce、AlltoAll、双二叉树和 Halving Doubling 等。这些操作用于神经网络训练中的高效数据交换和同步。
AI/ML 数据中心网络验证的挑战:
- AI 训练流量产生大量同步数据爆发,使网络缓冲区和队列不堪重负。
- AI 集群中东西向流量的主导地位对交换结构提出很高要求。
- 拥塞管理配置不当可能导致数据包丢失、训练作业延迟或网络链路利用率不足。
- QoS 配置错误会悄无声息地降低性能。
- AI 工作负载的规模和相互依赖性使根因定位变得更加复杂。
揭示 AI 网络健康状况的统计数据:
- 数据包丢失、作业完成时间 (JCT)、尾部延迟、丢弃的数据包计数、重新排序的数据包、发送 (Tx) 和接收 (Rx) 速率的偏差。
- 对 ECN、CNP 和 PFC 活动的可见性。
TestCenter AI 测试解决方案概述:
- TestCenter 为 AI 数据中心环境提供高密度、多速率的性能测试,支持模拟真实的 AI 工作负载,包括基于 RDMA (RoCEv2) 协议和集合通信库 (CCL) 模式(如 AlltoAll、RingAllReduce 等)的流量。
- VIAVI 测试设备包括 A1 和 B3 系列高速以太网设备,支持 RoCEv2 特性,如 DCQCN、ECN 和 CNP,以及用于性能基准测试的自动化框架。
- TestCenter 的自动化工具允许对不同的帧大小、数据大小、端口速率和流量模式进行测试,并支持持续集成(CI/CD)工作流。
结论:
随着 AI 工作负载的不断扩大,底层网络架构的性能至关重要。组织需要反映 AI 流量独特需求的测试策略和工具,特别是集合通信模式、 RoCEv2 传输行为以及拥塞和流量控制的影响。通过模拟特定于 AI 的流量模式并测量作业完成时间、数据包丢失和尾部延迟,工程师可以识别瓶颈、验证配置并优化性能调优。借助这些功能,团队可以在交换结构、拥塞管理机制和 QoS 策略影响实时训练操作之前,对其进行评估。