现代化运维保障体系
运维需求与环境变化推动运维向智能化发展,智能运维以大数据平台和机器学习为核心,需与监控、服务台、自动化系统联动。政策助力我国智能运维产业兴起,阿里巴巴、京东、百度等企业已应用智能运维技术。中国信通院参与编制《中国AIOps现状调查报告(2023)》等,并制定AIOps能力成熟度系列标准,分为L1-L5五个等级,企业AIOps成熟度全面提升,更多企业进入L3进阶智能化运维阶段。AIOps场景应用广泛,质量和效率领域最受关注,超四成企业已建立智能运维系统/工具。国际电信联盟(ITU)发布首个智能运维(AIOps)国际标准,旨在推进智能运维能力体系架构共识,促进产业发展。
AIOps可观测性
随着技术发展,传统监控方式无法满足多云时代需求,可观测性成为关键。可观测性指系统内部状态、行为和性能等被可靠观察、分析和监控的程度,核心价值在于快速排障。OpenTelemetry开源框架推动可观测能力发展,Gartner预测30%企业将通过可观测技术提升数字化业务运行性能。可观测性能力实践路径强调数据存储方案和业务数据支撑,中国信通院制定可观测性能力要求标准,开放4个模块评估工作,赋能业务实现全景监控、智能运维和自修复能力。
运维大模型
政策支持推动国内外大模型技术发展,大模型成为科技竞争新高地。研运大模型针对软件研发、测试、运维领域,基于开源大语言模型定制化训练形成,用于辅助软件生命周期各阶段。中国信通院制定《研发运营大模型通用能力要求》标准,规范研运大模型能力建设。运维大模型分为八大模块、26个子场景,赋能运维智能化升级,标准现开启首批评估报名。大模型技术在运维领域应用广泛,主要实践方向为监控告警、自动化脚本生成、运维智能体,但落地应用仍待成熟,主要挑战包括训练语料质量、模型准确性和可解释性。
大运维体系标准介绍
全球宕机事件频发,系统稳定性成为行业热点,保障关键信息系统平稳运行受到高度重视。《关键信息基础设施安全保护条例》等政策强调系统稳定性保障。研发运营系统可靠性与连续性(SRE)聚焦信息系统稳定性研究,IT资源运营向精细化转型成为大势趋,FinOps理念推动企业开展IT资源精细化管理。中国信通院牵头发起《IT基础设施资源运营能力成熟度模型》标准,指导企业由IT资源粗放式管理向精细化运营转型。智能化运维(AIOps)能力成熟度模型第5部分:运维数据治理,强调数据治理对运维数智化转型的关键作用,解决数据汇聚、管控、治理体系等痛点问题。