背景与目标
互联网用户规模增速放缓,促使各大企业转向降本增效。同时,热点事件期间服务稳定性面临挑战,需要在降本增效与稳定性之间取得平衡。
微博平台基础设施现状与思考
微博平台基础设施发展历程中,存在资源整合不足、效率低下、稳定性瓶颈等问题。具体表现为:
- 成本:在线服务利用率不高,资源碎片化,局部成本优化难以达到全局最优。
- 效率:分散的运维体系导致运维壁垒,服务运行不统一,新特性推广难度大。
- 稳定性:全链路扩容时间已优化至4分钟,但多机房相互依赖导致容灾能力不可靠。
微博云原生PaaS平台建设
为解决上述问题,微博建设了云原生PaaS平台,整体架构围绕成本、稳定性和效率进行优化。
成本优化
- 资源使用标准化:统一性能、冗余度和规格标准,通过真实流量自动压测和多维度监控实现资源合理分配。
- 动态扩缩容:支持自定义指标、定时和预测性扩缩容,以及热点扩容,提高资源利用率。
- 在离线混布:在线优先但利用率不高,离线优先级低但利用率高,通过资源隔离和离线算力感知提升整体效率。
稳定性提升
- 服务质量分级:支撑第一波热点,统一热点应对体系。
- 多可用区建设:采用三可用区+双云部署,通过virtual-kubelet扩展下层集群,提升容灾能力。
- 依赖梳理与业务改造:基于Skywalking全链路追踪可视化服务依赖,通过Istio实现流量劫持和模拟多可用区环境,快速验证业务改造。
- 容灾演练:通过一键断网和恢复控制进行故障模拟,提升容灾演练效率。
效率提升
- 统一标准:服务描述、runtime、通用能力接入和应用交付标准化,通过gitops+argocd实现自动化部署。
- 应用交付标准化:通过标准化流程减少运维操作,提高效率。
总结与未来展望
案例启示:
- 快速验证关键技术点,落地MVP版本。
- 充分利用开源社区并回馈。
- 在现有架构基础上改造升级,减少迁移复杂度。
- 稳定性需要长期持续投入。
未来展望:
- 智能化服务画像、服务编排、热点检测与应对。
- 架构单元化,快速重建微博。
- 故障混沌化、攻防演练。