华为推出全新 A 系列加速器及机柜级架构产品 CloudMatrix 8,直接对标英伟达 GB200 NVL72,并在部分指标上超越英伟达方案。其工程优势不仅体现在芯片层面,更贯穿加速器、网络、光模块及软件层的系统级创新。
CloudMatrix 8 由 8 颗 Ascend 10C 芯片通过全互联拓扑连接而成。Ascend 10C 芯片性能约为英伟达 GPU 的三分之一,但数量是英伟达 B200 的五倍,因此系统整体算力可达 1000 PFLOPs,几乎是 GB200 NVL72 的两倍。此外,CloudMatrix 8 拥有超过 1.5 倍的总内存容量和 2.1 倍的内存带宽。
CloudMatrix 8 的设计考虑了中国电力资源丰富的优势,采用了 100%光互联、零铜缆的设计方案。虽然能效较低,但其功耗对中国而言并非限制性因素。一套完整的 CloudMatrix 系统可提供 500 千瓦的功耗,是英伟达 GB200 NVL72 机柜(约 1.5 千瓦)的四倍多。
华为 Ascend 10C 芯片虽然性能优异,但生产仍高度依赖海外,包括三星的 HBM、台积电的晶圆以及来自美日荷的设备。中芯国际和长鑫存储已获得价值数百亿美元的设备,尽管面临制裁,仍从国外大量采购独家供应的化学品与材料。若 HBM 内存、晶圆制造设备、设备维护及光刻胶等化学材料未受有效管控,中芯国际的产能仍有巨大增长空间。
CloudMatrix 8 采用纵向扩展和横向扩展网络设计。纵向扩展网络使用 5,700 个 200G LPO 收发器,横向扩展网络使用 1,500 个 200G 收发器。线性可插拔光模块(LPO)的应用简化了模块设计,降低了功耗和成本,但由于仍需大量收发器,CloudMatrix 8 集群的功耗仍显著高于 NVL72。
以单颗 GPU 计算,华为每颗 GPU 的整机功耗约为 NVL72 中 B200 GPU 的 70%-80%。总体而言,华为超级节点提供的 FLOPS 比 NVL72 高出 70%,但其架构设计最终导致每 FLOP 的功耗高出 2.3 倍,每 TB/s 内存带宽的功耗高出 1.8 倍,每 TB HBM 内存容量的功耗高出 1.1 倍。
中国的能源优势将成为其数据中心在规模和速度上快速扩张的关键资产。虽然 CloudMatrix 8 的成本和功耗较高,但考虑到国家安全的重要性,中国愿意为此付出代价以匹配西方的计算能力。