核心观点
- AMD与OpenAI达成6吉瓦协议,共同开发基于AMD处理器的AI数据中心,推动AMD技术大规模部署,加速AI基础设施投入。
- AMD Instinct MI系列GPU采用台积电5nm工艺,配备HBM3/HBM3E内存,Infinity Fabric芯片间带宽约896GB/s,支持低精度AI数据格式,MI300X单卡峰值达2600TFLOPS FP8算力。
- MI300系列采用Chiplet小芯片和3D垂直堆叠技术,将计算、缓存、内存紧密耦合,引入256MB Infinity Cache三级缓存和改进的内存层次结构。
- MI300AAPU将CPU与GPU集成在同一封装,通过一致性Infinity Fabric实现高速互连和统一内存寻址,实现真正的异构融合计算。
- MI400系列预计采用代号“CDNANext”的新架构,AI计算力相比MI350再翻一番,集成432GB HBM4内存,HBM4带宽高达19.6TB/s。
- AMD的机柜级部署方案采用多GPU加速计算节点作为基本单元,通过高速网络连接,实现规模化的算力提供,强调节点内高速直连+节点间大带宽分布式互联,辅以先进的液冷散热。
- AMD布局互连技术,包括收购Pensando公司推出数据处理单元(DPU)和主导推动UALink开放互连协议,建立高带宽、低延迟、可扩展的GPU互连生态。
- Pensando DPU提供超高带宽网络接口,并在网络层执行智能化的通信加速,使AMD GPU集群可以在标准以太网上达到接近InfiniBand级的性能。
- UALink是由AMD牵头、多家公司参与制定的开放式加速器互连标准,目标是为GPU/AI加速器提供大规模扩展的统一内存语义互连,采用200G SerDes技术,便于快速推进。
- UALink单port/Link性能可达800Gbps,与NVLink 5单port/Link性能类似,胜在开放性和可扩展规模,服务器厂商可以自由实现将数十上百GPU构成一组UALink域。
- 我国企业加速布局UALink,以破局NVLink在GPU间低互连、高带宽的“垄断”,相关公司包括兆龙互连、澜起科技、紫光股份、盛科通信-U、中兴通讯等。
关键数据
- MI300X单卡峰值达2600TFLOPS FP8算力,约1300TFLOPS FP16/BF16算力。
- MI300系列功耗极高,MI300X加速卡热设计功耗(TDP)高达750W。
- MI400系列预计集成432GB HBM4内存,HBM4带宽高达19.6TB/s。
- MI400的AI计算力据称相比MI350再翻一番——官方给出的性能是FP4精度40PFLOPS、FP8精度20PFLOPS。
研究结论
- AMD采用UALink解决方案有利于开放生态互连,或加速国内超节点内部互连进程,减轻对NVLink的依赖。
- UALink作为业界开放标准,与NVIDIA的专有NVLink技术在目标上类似,但在性能方面,UALink胜在开放性和可扩展规模。
- 我国企业加速布局UALink,以破局NVLink在GPU间低互连、高带宽的“垄断”。