登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
武安闯-B站 SRE 转型历程与可靠性工程实践
建筑建材
2023-10-08
2023 DOIS DevOps 国际峰会 · 北京站暨 BizDevOps 企业峰会
CS杨林
B站SRE转型历程与可靠性工程实践
1. SRE概述
定义
:SRE(Site Reliability Engineering,网站可靠性工程)是一种利用软件工程的方法和思维来替代人工操作,解决运维问题的方式。SRE团队主要由50%-60%的标准软件工程师和40%-50%具备特定技能的工程师组成,其中50%的精力用于开发工作。
区别
:SRE与传统运维和DevOps的主要区别在于SRE更注重工程和自动化,而DevOps则更侧重于文化和流程。
2. SRE转型中的保驾护航
人员与组织支持
:通过团队认可SRE文化、定义职级能力模型、提供SRE发展路线,并通过导师帮助、技术分享会等方式支持SRE转型。
组织结构
:从运维向SRE转型过程中,逐步引入SLO(Service Level Objective),并构建Oncall轮值机制,实现工程开发与治理的平衡。
3. SRE可靠性框架
高可用架构
:采用多活容灾、微服务架构等技术手段,确保系统的高可用性和容错能力。
技术风险体系
:通过SLO(Service Level Objective)进行质量监控,实施变更管理、混沌工程、容量管理等措施,提升系统可靠性。
质量运营
:建立NOC值班、风险运营、生产专项等机制,保障系统的稳定运行。
4. 可靠性工程实践
多活容灾
:通过DC(数据中心)间的数据同步和负载均衡,实现业务的高可用性和容灾能力。
SLO(Service Level Objective)
:定义并监控各项服务的关键指标,如可用性、延迟等,确保服务质量。
故障快恢
:实施1-5-10原则,即1分钟发现故障、5分钟内进行处置、10分钟内恢复正常运行,提高故障恢复效率。
总结
B站在SRE转型过程中,通过构建高可用架构、技术风险体系和质量运营平台,实现了从传统运维向SRE的全面转型。特别是在SLO和故障快恢方面,B站通过具体的实践措施,显著提升了系统的可靠性和稳定性。
你可能感兴趣
2-4 武安闯-SRE实践:从SLO工程到GOC体系建设
建筑建材
2023 Gdevops全球敏捷运维峰会
2023-08-03
数智化趋势下的SRE转型实践
开放运维联盟&高效运维社区&DevOps时代
2023-01-01
大型国企如何实施IT运维SRE转型——暨北京移动IT运维转型实践分享
信息技术
中国移动通信集团北京有限公司
2025-04-30
大型国企如何实施IT运维SRE转型——暨北京移动IT运维转型实践分享
中国移动通信集团北京有限公司
2023-05-22
2-2 章清云-浙江移动SRE运维体系成熟度研究与实践
信息技术
2023 Gdevops全球敏捷运维峰会
2023-08-01
张立科-市场与服务支撑中心:打造卓越标杆 SRE 运维体系实践
信息技术
2024 第22届 GOPS 全球运维大会暨 XOps 技术创新峰会 · 深圳站
2024-05-13
2024年SRE实践白皮书v1.0.4
信息技术
SREelite
2024-09-18
中国式现代化的发展历程与实践路径
中央党史和文献研究院&中国人民大学&中国社会科学院&北京大学&中央党校
2024-04-30
3-3 海外游戏数据中台 SRE 实践 - 刘杰
文化传媒
DataFunSummit2022:数据科学在线峰会
2022-06-13
腾讯游戏SRE在复杂异构业务中的云原生服务实践
开放运维联盟&高效运维社区&DevOps时代
2023-01-01