确定性运维通过构建可防、可控、可治的运维管理体系,助力企业实现安全可靠、智能运营的目标。其核心在于确保系统的稳定性、可靠性以及高效性,从而降低故障概率,缩短故障恢复时长,并控制故障影响范围。
确定性运维的实践路径包括:
- 质量文化: 自上而下强调质量重要性,构建开发与运维团队共同的质量目标和方法,并推动运维团队从“消防员”向“建构师”转型。
- 高可用架构: 瞄准SLO目标进行架构设计,授予运维团队在业务规划设计(OBP)和上线前(PRR)Say No的权力,并定期验证高可用设计。
- 动态风险治理: 针对变更作业、故障模式、业务运行数据开展全生命周期的主动运维和能力构建,包括版本发布架构体系建设、账号权限管理、自动化变更能力建设、故障模式库、应急预案、监控覆盖设计、容量预警等。
- 智能运维工具: 选择合适的工具和技术,将其与现有系统进行整合,并关注新兴技术和发展趋势,不断更新和升级智能运维工具。
确定性运维的体系包括:
- 管理体系: 基于ITIL标准构建标准化运维,建立三线运维支撑团队,建立覆盖关键运维活动的流程规范,建设统一运维平台。
- 技术体系: 包括高可用能力、持续交付能力、运维能力可信、风险治理能力、资源治理能力、安全合规能力六大领域。
高可用能力实践:
- 业务可用性度量(SLO/SLI)设计: 通过SLO/SLI度量业务质量承诺和业务中各模块的责任,以数据为依据促进研发和运维协同不断优化业务可用性。
- 架构高可用设计: 在业务设计阶段将高可用架构设计落地到开发中,减少故障发生,缩短故障中断时长,控制影响范围,增强用户体验并满足严格的SLA要求。
- 监控设计: 通过监控告警体系直接决定确定性恢复能力构建与SLO达成,监控告警体系能够直接决定一些故障的恢复时长。
持续交付能力实践:
- 生产准备度评审(PRR): 在版本发布前进行可用性评审,确保版本发布质量,核实业务系统非功能需求规范中的构建运维能力和业务可用性的落地能力。
运维能力可信实践:
- 故障快恢: 建立应急预案,提升故障恢复效率、降低故障恢复时长,通过故障模式库和恢复预案库的建设,实现确定性恢复。
- 混沌工程: 通过故障注入,验证系统可靠性以及故障快速恢复能力,实现系统风险消减、业务快速恢复。
- 性能压测: 保证业务系统可以在达到设计最大负载(或QPS)时依然可以正常运行。
- 告警管理: 通过减少无效告警和衍生告警的数量,提升告警准确率和先于客户发现率,减少对运维人员的干扰。
风险治理能力实践:
- 变更风控: 通过风险数字化度量分析和评估风险影响程度,并采取风险控制措施削减或规避风险,保障变更成功。
- 护航: 在重要节日、推广大促、上线开服和云展会等重大活动期间,实施相关管理和技术保障服务,保障业务稳定度过高峰。
- 数据驱动运营: 让数据对运维业务产生实际的价值,数字化运营基于运维数据运营体系,通过运维数据规划、收集、分析并结合各类运维数据产品向运维业务团队提供数据可视化服务、定位问题并提出解决方案。
资源治理能力实践:
- 容量管理: 通过合理的资源规划、分配和调度,企业能够避免资源的浪费和闲置,提高资源的利用率。
- 成本管理: 帮助企业深刻地理解云资源和成本的关系,对用云过程中的支出进行高效地控制和优化,实现云投资的价值回报最大化。
安全合规能力实践:
- 安全生产: 从人员、工具、产品能力、流程规范等方面在安全预防、过程监控、结果稽查等维度进行端到端管理,减少或防止现网故障的发生。
- 出海运维合规: 确保企业在境外市场开展业务时遵守当地法律法规和商业规范,避免数据安全与隐私保护违法违规行为带来的法律风险和商业风险。