算力调度行业综述
算力定义与分类
- 算力定义:计算机设备或数据中心处理信息的能力,狭义用FLOPS衡量,广义包括数据存储、网络传输、任务调度等能力。
- 算力分类:
- 基础通用算力(CPU服务器)
- 智能算力(GPU、FPGA、ASIC等)
- 超算算力(超级计算机/高性能计算集群)
- 算力重要性:数字经济基石、科技创新驱动力、社会基础设施。
算力规模与数据生产
- 中国算力规模:2024年280EFLOPS,智能算力占比32%(90EFLOPS),全球第一。
- 数据生产总量:2024年41.06ZB,同比增长25%,智能应用推动数据量同比增长40.95%。
算力网络与算网融合
- 算力网络:基于互联网基础设施,通过标准化标识、智能调度实现算力资源互联互通。
- 算网融合:计算资源与网络资源的深度整合,实现算力“即插即用”和网络的“按需适配”。
- 中国移动算网融合架构:
- 算网基础设施层:全光网络与IP承载技术构建云-边-端算力互联。
- 编排管理层:人工智能和大数据技术实现算力资源统一纳管和动态编排。
- 运营服务层:整合算网资源与场景需求,提供一体化算力服务。
异构算力定义与分类
- 异构算力:结合多种不同类型处理器(CPU、GPU、FPGA、ASIC等)协同工作,发挥不同硬件架构优势。
- 异构计算分类:
- 狭义:单一计算系统内部集成多种处理器实现硬件协同。
- 广义:跨设备、跨网络的多层级技术整合,实现异构资源高效调度。
算力调度平台与异构计算调度系统
- 算力调度平台:面向多类型计算资源的统一调度系统。
- 异构计算调度系统:专门针对异构硬件架构的任务调度系统。
算力调度平台架构与技术
- 技术架构:基础设施层、管理编排层、服务运营层、算力应用层。
- 关键技术:算力感知、算力度量、算力路由、算网编排、算力交易。
异构算力调度面临的挑战
- 资源异构性与软件环境差异:增加调度复杂性。
- 跨架构任务迁移成本高:适配技术复杂多样。
- 缺乏统一调度标准:生态割裂导致资源错配。
- 异构硬件性能动态变化:传统调度模型无法精准预测。
国内主要算力调度平台
- 国家级平台:政府主导或运营商/头部企业建设,强调跨区域协同与市场化交易。
- 省级平台:覆盖长三角、成渝、京津冀等重点区域,结合本地产业需求。
- 市级平台:聚焦本地AI、智能制造等场景。
- 平台主导方:运营商主导整合跨区域资源,科技企业/行业服务商聚焦垂直领域。
开源算力调度技术平台
- 国内平台:多基于开源平台打造。
- openFuyao:新兴多样性算力调度平台,国产化适配优势。
- Kubernetes、Slurm:成熟项目,云原生和HPC领域有深厚积累。