Trainium3 是亚马逊推出的新一代 AI 加速器,旨在提升性能并降低总拥有成本 (TCO)。其核心策略是采用“阶梯函数”方法,通过多阶段改进硬件和软件,实现快速上市和成本效益。
硬件方面:
- 制程升级: 从 N5 工艺升级到 N3P 工艺,提升频率和降低功耗。
- 内存提升: HBM3E 内存堆栈升级到 12 层,容量达到 144GB/芯片,带宽提升 70%。
- 互连优化: 采用 PCIe Gen 6,每芯片向上扩展带宽翻倍,达到 1.2 TB/s。
- 网络架构: 引入独特的交换式扩展拓扑,提升前沿 MoE 模型性能,并支持不同代扩展交换机,兼顾上市时间和成本。
- 服务器类型: 提供 NL32x2 和 NL72x2 两种机架 SKU,分别采用风冷和液冷,满足不同需求。
软件方面:
- 开源策略: 开源 PyTorch 后端、内核库和 XLA 图编译器,构建开放开发者生态。
- 性能优化: 支持多种数值格式,包括 BF16、FP16、FP32 和 MXFP8/MXFP4,并通过硬件加速优化性能。
- 灵活性: 支持多种并行策略,包括专家并行、张量并行和上下文并行,适应不同工作负载。
- 开发者工具: 提供 NeuronExplorer 性能分析工具,帮助开发者优化模型性能。
关键数据:
- Trainium3 每芯片支持 8 个 NeuronCore,每个 NeuronCore 包含张量引擎、向量引擎、标量引擎和 GpSimd 引擎。
- Trainium3 支持多种 PyTorch 原生 API,包括 torch.compile、DTensor、FSDP 等。
- Trainium3 在推理和训练工作负载上均表现出色,并支持动态 MoE 组 GEMM 和集合通信专用核心。
研究结论:
- Trainium3 是一个具有竞争力的 AI 加速器,在性能和成本效益方面具有优势。
- AWS 通过开源软件和灵活的硬件策略,提升了 Trainium3 的采用率。
- Trainium3 将对英伟达的市场地位构成挑战,但英伟达仍将保持领先地位。