智算网络与智算算力协同建设
1. 大模型训练与智能化生产力
- 大模型训练持续提速:大模型应用从2C现象级应用走向2B通用应用,正在逐步走向场景化2B应用。如Tesla自动驾驶训练从一个月缩短至一周内完成,以满足安全和竞争力需求。
- AI基础设施投资加码:中国预计2027年智能算力规模将达到1117.4EFLOPS,复合年增长率达33.9%。三大T已将智算云服务作为建设重点。
2. 智算集群与无损网络
- 智算集群步入超十万卡时代:Meta、特斯拉、字节跳动等公司已建立超十万卡级的算力集群。
- 高质量算内网络:800GE超高速互联和三层CLOS架构等技术,提高网络通信效率,减少算力闲置。
- 跨DC协同训练:通过长距无损联算网络,实现分布式算力聚池成海,如Google Gemini Ultra和微软GPT-6的跨区域训练。
3. 入算网络与弹性调度
- 高运力入算网络:构建高质量入算网络,实现智算云服务的商业变现,如九州算力互联网。
- 存算拉远协同训练:支持存算拉远训练,如上海证券交易所的数据安全需求。
- 弹性入算网络:解决海量样本“极速达”问题,如上海电信的“数据快递”项目。
4. 数字孪生与AI融合发展
- 网络数字孪生:提供网络调整、维护、优化等变更操作的试验和验证,降低试错成本。
- 网络大模型:华为发布首个网络大模型,覆盖6大类44个场景,提升网络管理和运维效率。
5. 网络智能化与运维模式变革
- 人机协同:从Copilot到AI Agent,实现运维流程智能化,提升运维效率。
- 主流厂商投入:华为等厂商积极开发Copilot和AI Agent产品,提升网络智能化能力。
行动建议
- 统一规划与协同建设:加强网络和算力中心的协同建设,实现算力随需覆盖。
- 引入新型组网架构:加速800GE等新技术的导入,构建超大规模算力集群。
- 促进长距无损算力互联网络建设:引入创新技术,打造算力互联网络,孵化新商业模式。