陈刚高效运维社区研报正文总结
一问:影响稳定性的罪魁祸首有哪些?
当代IT系统典型特征包括大规模、分布式、高频变更、技术栈复杂、大流量、高并发。影响稳定性的主要因素包括:
- 变更风险:约70%的生产事故由部署变更触发,日常变更多导致故障。
- 容量风险:流量突然增加(如重大活动)导致的故障,影响全局。
- 基础设施风险:网络/IDC/DNS等故障,频率低但影响重大。
影响稳定性因素的应对措施
- 变更与发布控制:规范变更流程。
- 容量管理实践:进行容量规划。
- 基础设施高可用:提升基础设施可用性。
二问:稳定性建设从哪里切入?
SLO的VALET模型
- SLA(服务等级协议):达到或未达到SLO后的后果,商业承诺。
- SLI(服务等级指标):服务质量的量化指标,如可用性、延迟、错误率等。
- SLO(服务等级目标):SLI的目标值,如可用性>99.99%、90分位RT<100ms。
- 黄金指标:Latency(延迟)、Traffic(流量)、Errors(请求错误率)、Saturation(资源利用率)。
SLO的引入与运营
- 引入SLO以量化可靠性,通过错误预算管理。
- 采用多窗口多燃烧率(MWMB)告警策略,平衡及时性、误报、漏报。
三问:SLO如何与可观测能力打通?
可观测数据MELT
- Metrics(指标):实时性能数据。
- Logs(日志):系统操作记录。
- Traces(追踪):请求链路信息。
- Events(事件):异常事件记录。
可观测体系应用场景
- 统一MELT数据生命周期管理,解耦实时和历史数据。
- 提供单一查询接口,支持云原生分布式部署。
四问:SRE实践中如何协同故障应急?
故障应急流程
- 重启:最廉价的服务恢复手段。
- 回滚:回到上一个稳定版本。
- 扩容:短暂提高系统资源池。
- 切流:机房或运营商切换。
- 降级:降低标准服务以保命。
- 限流:辅助招式,可组合使用。
故障应急协同机制
- 通告标准:对业务有影响、基础设施不可用。
- 进展同步:关键发现、处理、影响扩大、业务恢复。
五问:如何系统化建设SRE稳定性能力?
SRE的范围
- 职责:保障基础设施稳定性和可扩展性。
- 方法:通过操作类事务积累经验,提升解决效率。
- 工作内容:日常需求处理、容量规划、监控告警、应急响应等。
SRE的组织文化
- 高度合作:产品运营、开发、管理协同。
- 共同信念:SLO量化可靠性,错误预算管理。
- 鼓励交流:数据驱动可靠性对话。
- 共担风险:SLI和SLO一致,风险共担。
- 接纳新颖想法:从失败中学习,传播最佳实践。
SRE的能力要求
- 协作:项目跟进、事故复盘、变更管理等。
- 技术支持:系统迁移、应急响应、故障处理等。
- SRE实践:运行风限控制、服务分类分级、SLO运营等。
- 架构能力:高可用、多活、弹性伸缩等。
- 组织调整:轮岗、值班、OnCall等。
SRE建设思路