支付宝商家可用性监控体系演进历史
商家可用性监控的诞生背景
2012-2014年,支付宝线下支付拓展过程中,商家系统稳定性问题频发,影响用户体验和社会舆情。2014年双十二活动期间,部分商家系统宕机,促使支付宝开始构建千万级商家可用性监控体系,以更好地支撑生态发展。
商家可用性监控——探索&发展的历史
2014年:开始构建商家可用性监控体系,初期仅对50家头部商户进行固定阈值告警监控。
2015-2017年:监控范围扩大至千万级商户,覆盖支付类、应用类几十个重点业务,并上线影响面分析、恢复监控等功能。
2016-2019年:全面处置业务异动,上线离线监控平台,覆盖天级、小时级监控。
2020年:建立现象监控和长期问题监控能力,增强监控准确率。
2021-至今:解决千差万别的数据形态下的异常识别、处置优先级和策略问题,以及用户体感不可用问题。
商家可用性监控的现状
- 监控覆盖支付宝99%的商家业务,涵盖线下支付、线上支付、政企、民生、数字生活等。
- 监控发现率达到85%(召回率)。
- 沉淀了大量监控技术,包括风险监控、实时/离线监控技术、巡检、恢复计算、影响面分析、监控准确率技术、定位、复现、自动化管控技术等。
- 异常现象包括错误页、页面不存在、白屏、异常弹窗、卡顿、页面访问受限等几十种。
告警案例
- 突发故障自动X等级识别告警,自动分析定位解决方案,提供影响面分析,故障进展相关操作联动产品止血。
- 长期类问题监控,通过钉钉群同步案例,进行治理策略——问题池管理。
产品案例
- 质量监控中心&自动化管控,实现临时挂维护、活动/会场自动下架、搜索透出等场景的自动化管控。
商家可用性监控的整体框架
运行全流程
- 核心系统:数据中心、监控中心、处置中心。
- 工作台:监控工作台、保障工作台、应急工作台。
- 流程:准备→告警→应急止血→复盘分析→定位。
核心技术模块
- 监控告警:风险预警、告警降噪、事件合并。
- 监控分析:影响面分析、故障等级计算、恢复计算、定位复现、证据监控。
- 处置:监控室(人工)、质量监控中心(自动)、自动化管控。
关键领域模型
- 量级:万量级(关键领域模型)、百量级(用户异常)、千万量级(监控发现率)、千量级(异常事件)。
重点板块—监控告警
监控技术——三大类
- 基于异常痕迹监控:埋点监控(常用)。
- 主动探测:巡检(条件:有使用量&使用有异常)。
- 舆情监控。
基于原因监控VS 基于现象监控
- 核心链路监控:可解释性略差,突发故障监控效果好,长期问题监控效果差。
- 现象监控:可解释性好,突发故障监控效果好,长期问题监控效果好。
- 优势:告警和用户不可用现象直接挂钩,高准确率;异常现象关键大类可以穷举。
基于现象监控案例
- 白屏:通过节点加载检测、Palette算法提取主色、页面文件体积、纯色区域占比等方法识别。
- 异常弹窗:通过H5/小程序弹窗数据采集、隐私脱敏、专家经验识别、NLP算法识别等方法识别。
不同故障类型的不同监控技术
- 突发故障监控:核心链路监控。
- 长期性问题监控:离线监控。
- 商户-用户级问题监控:用户颗粒度聚合数据+阻碍性用户行为识别。
- 商户-大面积问题监控:商家颗粒度聚合数据+分钟/秒级商家数据波动。
监控准确率&降噪
- 值班室体感:通过误告识别、故障或非故障识别,减少值班室人工工作量。
- 商户体感:通过原因识别,解决值班室无法快速准确识别的异常事件。
- 效果:监控准确率从24.1%提升至70.6%,告警削减了66%;商户体感准确率从61.8%提升至73.0%。
影响面分析、恢复计算、故障等级案例
- 影响面分析原理:对比当前数据和基线,区域面积、错误总量等。
- 恢复判断原理:对比当前数据和基线,和异常前数据量对比等。
- 故障自动定级原理:影响面计算、恢复计算、恢复判断点恢复计算等。
- 效果:从成百上千的异常中将关注点投入到重大异常事件。
展望
未来生态监控愿景
- 内部数据+外部数据,信息输入(脸、眼睛/鼻子/耳朵)→自动化管控(嘴、四肢)→全局呈现、整体把控。
- 监控体系大脑(异常识别、分析定位、自动决策)→全自动智能实时感知生态异常。
- 利用多模态大模型对数据做内容理解,做到对更多未知现象、未知异常的识别。
- 真正的AI监控。