运维监控体系建设与可观测建设工具实践
个人简介
赵舜东,OpsAny创始人,花名“赵班长”,前武警部队自动化架构与运维负责人,2008年退役后长期从事互联网运维工作。荣誉包括阿里云MVP、华为云MVP等,并担任高效运维社区核心成员、SRE精英联盟创始成员等。著有《运维知识体系》《缓存知识体系》等书籍。
运维监控体系建设
可观测平台集成场景
运维监控体系建设需关注效率、成本、安全、质量四大维度,并融合DevOps与自动化技术。核心建设内容包括:
- 稳定性建设:高可用架构、可观测性、日志、智能告警、故障自愈
- 研发运营一体化:自动化资源交付、自动化运维编排、自动化应用发布
- 容量和成本建设:容量水位线监控、动态扩缩容、成本优化
- 安全管理:安全审计、主机安全、应用安全、网络安全
监控对象识别与理解
监控对象分为七类:
- 数据中心:流量监控(PV/UV/地域)、风火水电、温湿度
- 网络监控:APM(网络链路、延迟、丢包)、应用性能管理、调用链、拓扑
- 物理设备:CPU温度、风扇转速、硬盘故障
- 日志监控:错误日志、访问日志、运行日志、设备日志
- 操作系统:CPU/内存/IO监控、系统审计、漏洞扫描
- 应用服务:Nginx/Tomcat/MySQL等组件监控
- 业务监控:订单量、日活、新增用户数
监控方法与协议
提供开箱即用且兼容开源的百种组件监控,核心工具选择:
- 指标采集:
- Zabbix:企业级平台,需预先定义指标,适合基础设施监控
- Prometheus:灵活度高,无需预先定义指标
- Elastic技术栈:
- Metricbeat:轻量级指标采集器,支持Kafka传输
- Filebeat:轻量级日志采集器,可嵌入Kubernetes
- Heatbeat:服务可用性拨测,支持ICMP/TCP/UDP/HTTP/HTTPS
- Elastic技术栈企业级可观测采集架构:
- RUM:真实用户监控,采集Web浏览器交互数据
- Skywalking:APM监控,支持端到端调用链
可观测最佳实践
- 指标与告警:设置合理告警阈值,关联SLO实现基于SLO的告警
- 数据沉淀:向容量管理平台等扩展使用
- 可视化:多维度大屏展示
- 采集范围:涵盖主机、中间件、数据库、Web服务
- 指标类型:少告警阈值不同、高指标类型单一值为主
可观测平台集成场景
基于可观测平台实现:
- 智能告警:结合AI Ops实现无阈值告警、异常检测
- ITSM集成:告警通知转工单,流程流转
- 可视化拓扑:基于可观测数据实现应用架构拓扑图
- 容量与成本管理:基于可观测数据
- 智能告警优化:告警抑制、分组等
- 事件驱动自动化:ST2原子定义、工作流定义、规则定义
应用SLO建设
- 梳理用户体验层SLI(用户可感知功能、按钮)
- 校验SLI准确性,无SLI需客户端/服务端上报
- 创建监控策略,告警阈值基于SLO确定