2023年9月3日深夜,美国头部AI服务商ChatGPT、Claude、Grok等集体出现故障,谷歌Gemini、微软Copilot也收到大量中断报告。此次大规模宕机事件持续约3小时40分,根本原因是超大规模AI集群在高负载下的底层基础设施韧性不足。当前单卡功耗已迈入1kW+,单机柜功率向100kW+演进,传统供电架构在传输损耗、散热能力、供电冗余等多个维度均接近物理极限。
AI高功耗、强波动的负载特征要求整个供电链条进行系统性匹配。上游电网侧需提升发电设备、变配电设备、高压保护、备电设备的可靠性;机柜内部采用800V高压直流供电方案可实现高压降流,压缩线缆铜损,减少多级电压转换损耗;近芯供电端需通过VPD垂直供电及TLVR耦合电感、高性能DrMOS、高频电容等器件压低路径阻抗,改善瞬态响应。
报告重点分析了AI集群基础设施韧性不足的技术瓶颈,以及供电全链条升级需求。具体包括上游电网侧的可靠性提升、机柜内部的800V高压直流供电方案应用,以及近芯供电端的PDN网络优化。同时,报告梳理了发电、输配电、柜内/备电电源、近芯供电、测试电源等细分产业链的机会点。
当前AI市场对电源的需求持续增长,单卡功耗已迈入1kW+时代,单机柜功率向100kW+演进。传统供电架构面临传输损耗、散热能力、供电冗余等多维度挑战,800V高压直流供电方案成为行业发展趋势。相关产业链企业如春晖智控、四方股份、麦格米特等在各自领域积极布局,推动技术升级和产品迭代。
需关注下游资本开支不及预期、市场竞争超预期、出口政策风险超预期等风险。AI基础设施建设的投资规模和节奏存在不确定性,市场竞争加剧可能导致价格战,出口政策变化可能影响相关企业的海外业务拓展。