RDMA Telemetry技术概述
产生背景
RDMA技术发展历程
RDMA技术起源于InfiniBand,旨在解决传统TCP/IP协议栈在高性能计算环境中的高延迟和高CPU开销问题。InfiniBand通过专用硬件实现RDMA,具备极低延迟、高吞吐和无损网络等核心特征,但技术生态封闭,难以大规模部署。RoCEv2技术的出现解决了这一问题,通过在通用以太网上运行RDMA,实现了经济性、普适性和高性能的平衡。
RDMA与智算中心的融合
智算中心作为服务于极致算力需求的专用子系统,包含计算层、网络层和存储层。RoCEv2技术凭借其优异性能和良好兼容性,成为智算中心各层间数据通信的核心标准,主要加速计算平面通信(GPU间同步)和存储平面访问(数据供给与持久化)。
RDMA网络质量监控的需求与挑战
传统网络监控技术无法满足RoCEv2网络的极端性能监测需求,主要体现在精度不足、检测粗糙和实时性差等方面。
RDMA Telemetry技术的诞生
RDMA Telemetry技术专为RoCEv2网络设计,提供I/O质量可视和吞吐量可视两大核心功能,通过端到端、分段式的实时性能监测,为高性能数据中心网络提供全面的可视化解决方案。
技术优点
RDMA Telemetry技术相比传统网络监控技术具有精准的故障定位能力、实时的性能监控、智能化的运维支持和广泛的场景适应性等优势。
RDMA Telemetry技术实现
I/O质量可视功能
功能简介
I/O质量可视功能的核心是对存储网络(GPU服务器访问存储服务器)的端到端传输时延进行分段测量,将存储路径划分为计算侧、网络路径和存储侧三个逻辑区段,并分别对每个区段的读写操作时延进行实时毫秒/微秒级监测。
系统架构
RDMA Telemetry采用分布式监控架构,由控制器+分析器和测量设备组成。控制器通过NETCONF接口下发测量配置,设备通过gRPC功能上报测量数据。
网络分段测量
RDMA Telemetry将数据中心存储网络分为计算侧、存储侧和网络路径三段进行监控。
测量策略
RDMA Telemetry支持对重点保障流量进行持续监控,对非重点保障流量进行轮询监控,以适应不同用户的组网需求并降低网络负载。
测量指标
RDMA Telemetry按周期测量并计算DPL(数据准备时延)、RTT(双向时延)和DAL(数据访问时延)三类对象的平均值。
读操作交互流程
RDMA Telemetry通过测量关键报文的时间戳,计算DALread、IOL1、IOL2和RTT等指标,实现对读操作的全流程监控。
写操作交互流程
RDMA Telemetry通过测量关键报文的时间戳,计算DALwrite、DPL、IOL1、IOL2和RTT等指标,实现对写操作的全流程监控。
吞吐量可视功能
功能简介
吞吐量可视功能是针对智算中心计算平面通信性能瓶颈而设计的核心监控能力,专门监控GPU服务器间基于纯RoCEv2协议的RDMA Write操作流,关注应用层的有效数据传输效率。
测量策略
吞吐量可视功能提供全量监控模式和轮询监控模式,用户可以根据实际网络规模和资源情况选择最适合的监控策略。
测量指标
吞吐量可视功能定义了FCT(流完成时间)、FET(流有效吞吐率)和FNR(流重传率)三个核心指标来全面评估通信健康度。
运行机制
吞吐量可视功能通过跟踪RDMA流的全生命周期,记录首包到达时间戳、末包到达时间戳、NAK重传报文计数、有效数据量和无效数据量等数据,并按配置周期计算FCT、FET、FNR等指标。
RDMA Telemetry可视化
RDMA Telemetry和gRPC功能配合,将测量数据上送给AD-DC分析器,在分析器上图形化展示RDMA Telemetry测量结果,支持按主机IP维度或存储IP维度可视化呈现I/O时延、数据准备时延、数据访问时延、网络RTT等指标。
典型组网应用
AI训练存储网络I/O质量监测
通过在AI训练存储网络中启用I/O质量可视功能,可以实现对每个训练作业I/O操作的全链路时延分解,为训练作业性能诊断、跨团队协作效率和基础设施优化提供支持。
AI训练计算平面梯度同步性能优化
通过在AI训练计算平面中部署RDMA Telemetry吞吐量可视功能,可以实现精准时延监控和拥塞快速定位,提升AI训练效率。