登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
UPN512 技术架构白皮书 v1.0
信息技术
2025-09-23
阿里巴巴
苏吃吃
总结
AI基础设施网络的发展趋势
随着人工智能技术的发展,大模型训练和推理任务对算力和内存的需求呈指数级增长。
智算集群通过高性能网络进行集群算力扩展,已从万卡向十万卡、数十万卡级别迈进。
MoE(Mixture of Experts)模型结构逐渐代替Dense模型结构,对网络提出超大带宽和超低时延的要求。
智算集群的算力负载从预训练逐步向训推一体演进,对网络架构设计提出更高的要求。
通过xPU Scale up扩展提升集群化算力成为主要趋势,如NVIDIA GPU Scale up域已由8卡风冷系统演进到72卡液冷系统。
xPU Scale up网络的演进和挑战
超大带宽超低时延的Scale up网络互联可以有效提升xPU超节点的集群化算力。
MoE模型的发展趋势对Scale up互连域的扩展提出要求,主流算力系统的演进方向都在考虑做更大的Scale up网络互联域。
目前Scale up系统大多采用铜缆互连方案,但高密Rack设计使得系统复杂性急剧增加,可靠性受到挑战,系统扩展性有限。
光互连是更大范围Scale up网络互联的必然选择,但面临成本和可靠性两大挑战。
成本分析显示,超过铜缆覆盖范围的场景(>128xPU),采用传统单层光互连方案要比2层(铜+光)方案的成本更低。
大规模Scale up架构可靠性设计的重心应转移到面向更好容错的系统架构上,并兼顾互连本身的可靠性。
xPU算力和显存HBM的不断扩展,大带宽下的内存数据交换需要消耗更多的计算资源,如何设计更好的网络传输语义和在网计算能力是另一个挑战。
阿里云UPN512架构概览
阿里云提出UPN(Ultra Performance Network)Scale up网络系统,继承HPN(High Performance Network)Scale out网络的设计理念。
UPN架构的主要设计基于三点:
基于High Radix以太网,规模大、可扩展。
采用LPO/NPO光互连,解耦高密机柜依赖,降低成本、提升可靠性。
基于单层交换的协议设计,简化协议设计,扩展定义网络通信语义和在网计算。
UPN512系统设计和关键组件
UPN512利用光互连连接XPU和交换机,通过单层CLOS网络实现512个xPU的全互连。
xPU和Switch芯片通过光电引擎(OE)实现光电转化,LPO和NPO是UPN512系统的优选方案。
UPN512架构本身的解耦设计是高可用设计的一部分,使得故障单体的影响面更小,更换效率更高。
单层网络相比多层网络能够做到最简拓扑和最短时延,实现单层千卡需要突破距离限制和芯片限制。
当前AI Rack设计为了利用铜互连,整个硬件系统做到了极致紧凑和耦合,UPN512架构解耦了高密机柜依赖。
光互连概览
可插拔光互连方案以FRO和LPO为主,LPO去除了DSP,在功耗、时延、成本方面有显著的收益。
高密带宽光互连方案包括CPO和NPO,NPO更具备可行性,采用OIF标准封装,通过LGA连接器实现可拆卸、可替换。
LPO和NPO作为UPN网络的两个选项,可以应用在不同的场景,LPO适用于带宽需求不高且芯片Serdes能力较强的时候,NPO适用于带宽密度高或者芯片Serdes能力不足时。
LPO/NPO技术在光成本上降低30%~40%,使得整体解决方案的网络成本降低,并将来随着产业生态的进一步成熟丰富,网络成本将进一步降低。
LPO/NPO技术所使用的关键器件和传统的FRO可插拔光模块相似,去除了DSP芯片,失效点少,理论上LPO/NPO的互连互通兼容性问题会得到改善。
传输语义
UPN512架构采用的低时延传输方案基于ETH+协议,提出三种不同的低时延语义:面向内存的Load/Store语义,面向消息的Send/Recv,以及针对大模型场景网络通信优化的张量(Tensor)Push/Pull语义。
内存语义适用于状态同步、控制变量读写、分布式信号处理、以及小块数据的搬运等场景。
消息语义适用于传输数MB到GB级别的大块张量或模型权重,通常用于AI训练过程中的前向传播结果同步、梯度合并或参数写回等场景。
张量语义面向大模型应用针对性优化,提供异步IO、批量/流式传输、显式/隐式消息确认、最小化张量传输延迟、动态压缩、在网计算等能力。
在网计算
在网计算是一种利用网络设备对集合通信进行加速的技术,可以显著加速AllReduce类集合通信的完成时间,也可以显著降低ReduceScatter、AllGather、Dispatch、Combine等集合通信的显存带宽/计算资源开销。
UPN架构基于以太网,对下一代在网计算进行如下定义:
交换芯片方面,下一代以太网交换芯片需要满足“可计算”的能力。
协议方面,提出与协议解耦且通用的在网计算标准,任何基于以太网的Scale-up协议均可以通过支持“扩展计算头”,搭配可计算ASIC,实现内存语义级别的在网计算能力。
通信标准方面,按照集合通信收发侧数据量的规律,分为对称集合通信和非对称集合通信,并分别给出在网计算流程。
你可能感兴趣
UPN512技术架构白皮书v1.0
信息技术
阿里巴巴
2025-10-11
理想星环 OS 技术架构白皮书 v1.0
理想汽车
2025-04-15
工业互联网安全架构白皮书(V1.0)
信息技术
北京六方云信息技术有限公司
2020-05-31
通信行业:中国移动5G行业专网技术白皮书v1.0(2020年)
信息技术
中国移动
2020-07-09
2023小米澎湃OS技术白皮书V1.0
电子设备
小米
2023-12-27
超节点技术体系白皮书_v1.0
信息技术
上海人工智能实验室
2026-03-31
阿里云物联网平台技术白皮书V1.0
阿里巴巴
2022-03-10
鸿蒙生态应用安全技术白皮书V1.0
信息技术
华为
2023-08-30
2023智慧高速F5G全光通信网技术白皮书 V1.0
信息技术
华为
2023-10-22
6G原生AI架构和技术白皮书
信息技术
中国移动研究院
2022-12-19