AI 行业过去几年经历了高强度的基础设施军备竞赛,但 2025 年开始,支撑 AI 发展的供应链策略需要重新调整。新的两大核心要素——敏捷性和成本效率——正在重塑行业对 AI 基础设施的认知。
原有策略与挑战
过去五年,AI 部署主要关注两大指标:原始性能(芯片和模型先进性)和部署速度(数据中心集成效率)。这推动了企业垂直整合,但如今 AI 推理成本激增、收入压力增大,迫使巨头重新评估。具体挑战包括:
- 成本爆炸:AI 计算成本失控,特别是 AI 代理自主生成更多工作负载导致资源需求呈指数级增长(如微软、OpenAI、谷歌面临成本预测难题)。
- 推理瓶颈:ChatGPT 等应用可能突破 10 亿活跃用户,AI 推理(持续运营支出)必须实现可持续成本控制。
- 收入挤压:AI 定价模式被打破(如中国巨头订阅费最高削减 97%),美国科技巨头则通过免费 AI 功能押注未来变现,但策略仍不确定。
关键指标演变
行业优先级从“速度与性能”转向“适应性与成本效益”。核心要素从“人才、模型、数据、芯片”扩展为六大基础设施环节:数据中心建设、发电、计算硬件、基础设施设备、房地产和电信网络。这些环节面临瓶颈:美国数据中心预计到 2030 年将消耗全国 9.1% 的电力,微软重新评估数据中心计划,弗吉尼亚州新数据中心电网连接时间超 7 年。
供应链策略调整
为平衡性能、速度、灵活性和成本,企业需采用“战略外包”策略:
- 计算硬件:转向外部云和托管服务商(如 OpenAI 与 CoreWeave 合作),以规避硬件采购周期和供应链限制,但牺牲定制化性能优势。
- 能源:通过可再生能源合作和电力购买协议(PPA)锁定成本,但清洁能源部署滞后于 AI 扩张(如德州电网因 AI 用电激增面临压力)。
- 房地产:弗吉尼亚州凭借网络流量、税收优惠和电力成本优势成为热点,但选址决策复杂,外包给专业机构更高效。
- 电信网络:企业正转向租赁电信服务(如 Google、Microsoft、Amazon 扩建私有光纤网络),以避免巨额投资,但依赖少数服务商。
结论
AI 基础设施无法采用单一模式。领先企业需将数据中心组合视为“投资组合”,结合自建和外包:
- 训练负载:保留专用 AI 优化设施以追求极致性能。
- 推理负载:采用混合模式(自建和租赁标准数据中心)以灵活应对需求波动。
最终,融合自研与外部合作的企业将更高效地扩展 AI,避免僵化模式陷阱。