AI基础设施正从训练导向转向推理优化,网络与能耗成为核心挑战。算法创新如Mixture-of-Experts、精度训练与强化学习提升了推理阶段资源复用率,行业更关注通过蒸馏、压缩等方法优化推理性能。数据中心部署呈现训练/推理分化:训练集群建于新址(greenfield),强调高GPU密度;推理集群依托旧有数据中心(brownfield)扩建,支撑实时服务。网络选择需权衡性能与开放性:NVLink适用于节点内通信,InfiniBand适用于跨节点通信,CPO光电共封装是未来趋势。Meta推动软硬一体化,自研规格与Whitebox并举以优化性价比,网络硬件与内部软件深度融合,存储采用Hammerspace软件实现灵活部署。IDC架构更适配AI训练负载,电力与散热仍是核心瓶颈,超大厂探索液冷、新型能源(如核电)、智能电网互联等方案,保障训练集群高可用性与可持续性。