一、数字化转型运维问题挑战
数字化转型过程中,企业面临的主要运维挑战包括:
- 故障快速抢通:指标复杂难分析、数据不互通、告警无人关注、处理缓慢、无法自愈及自动化
- 故障快速发现:24小时值守困难、故障管理效率低、无应急方案
- 故障优化预防:系统调用关系复杂导致排查困难、故障复盘改进效果差、全链路瓶颈点和容量水位未知、隐患无法察觉
- 故障快速定位:云原生下容器与主机关联不清、问题定位困难
云原生环境下,企业IT架构呈现分布式、多云多集群部署趋势,运维面临分布式架构、运维生态、业务连续性三大挑战。
二、数字化监控平台整体架构
数字化监控平台基于云原生生产运营支撑平台,提供端到端、全层级运维工具支撑,依托大数据与人工智能技术,实现从传统运维向自动化生产、智慧化运营的转变。
平台采用“平台+应用”模式,构建企业运维生态,提供PC/移动多终端处理能力,入驻应用100+,实现统一规划、架构、登录、权限、能力和风格。
三、智能运维场景的应用实践
智能运维核心场景包括端到端的故障发现、定位、调度、处置、整改、预防。
1. 统一监控告警
- 提供IaaS、PaaS、SaaS各层级监控能力,实现多层级运维数据互通
- 支持全流程可视化配置、多渠道告警通知、工单闭环管理
2. 全流程调用链监控
- 通过探针非侵入式采集,实现调用链实时追踪、全层级故障根因定位
- 支持多租户、多系统接入、服务链路拓扑、多维根因定位分析
3. 跨系统分布式追踪
- 支持跨系统、跨云平台(CKE/CCS/EDAS)、跨数据中心链路拓扑
- 日均处理近千亿数据
4. 前端触点监控
- 采用JS埋点采集用户访问性能指标,获取浏览器端真实用户行为数据
- 应用于故障定位、安全分析、终端分析等场景
5. 一键智能诊断
- 实现指标、链路、报文日志三位一体可观测性
- 结合云化CMDB关联定位,实现全层级一键诊断
6. 故障诊断
- 依托全层级监控指标数据、链路调用、云原生CMDB建立故障传递模型
- 以服务层为起点纵向串联,配以规则+AI实现全层级一键智能故障诊断
7. 智能故障自愈
- 将“监”“管”“控”工具能力融合,告警信息结合AI判定算法触发自动化作业
- 缩短故障处理、恢复时间
8. 故障闭环管理
- 故障事前、事中、事后全流程线上闭环管理
- 提升故障管理质量和效率,降低故障时长及次数
9. 智能隐患分析
- 结合监控指标与容量指标,定期开展容量隐患评估
- 通过全链路压测分析性能瓶颈,建立健康度算法模型识别治理潜在风险
10. 亚健康检查
- 自动获取全层级核心黄金指标,通过AI算法分析优化健康度模型
- 实现系统健康状态档案化管理,治理潜在风险隐患
11. 性能对比与系统体检
- 系统性能对比页面可选取发版前后时间对比各指标
- 周期性观测故障预防统计以日、周、月维度统计问题项
- 实时健康体检实时计算全层级指标,根据阈值判断异常及风险程度
成果实效
- 运营工具生态:打造生产运营保障工具生态,完成100+工具建设,节省人力200+,节省人工成本7200W
- 政企市场突破:孵化商业产品对外输出,实现在政府、电网等20项成果输出
- 重大活动保障:实现冬奥会等重大活动保障任务万无一失
- 核心系统稳定性:大幅提升系统稳定性,保障业务连续可用率