深耕于蚂蚁集团基础设施 SRE 领域,负责蚂蚁全站的容器调度和应用网络接入系统的高可用建设。目前的主要兴趣点在于对于规模化集群的运维提效,以及围绕 SLO 理念开展高可用的系统建设。在加入蚂蚁集团之前,曾就职于谷歌 SRE 团队,负责身份认证和权限系统相关的稳定性建设。
本次分享围绕蚂蚁基础设施 SRE 团队在云原生架构的演进过程中的的稳定性建设,复盘真实的生产故障案例,探讨在云原生的时代的技术风险防控策略。针对 SRE 的经典方法论之一的 SLO 体系,对于其在云原生场景的构建、扩展和运营,将结合真实的使用场景,剖析难点和挑战,并给出具备可操作性的解决路径。
演讲提纲:
1. 引论
2. 云原生场景下的稳定性建设的特征分析
3. SLO 驱动的技术风险防控体系
4. 总结展望:SLO 使用的三个阶段
你将获得:



微信咨询

电话咨询
微信联系我们

