我们差点挂了!本专题将邀请一线专家分享宝贵的故障复盘及稳定性建设经验。
... 展开 >




丁雪丰,美团金融服务平台研究员,极客时间《玩转 Spring 全家桶》课程讲师,腾讯云最具价值专家。活跃的技术图书作译者,出版了《Spring Boot 实战》、《RESTful WebService Cookbook 中文版》等 8 部图书,致力于推动优秀技术在国内的发展。
我们差点挂了!本专题将邀请一线专家分享宝贵的故障复盘及稳定性建设经验。
本次分享围绕蚂蚁基础设施 SRE 团队在云原生架构的演进过程中的的稳定性建设,复盘真实的生产故障案例,探讨在云原生的时代的技术风险防控策略。针对 SRE 的经典方法论之一的 SLO 体系,对于其在云原生场景的构建、扩展和运营,将结合真实的使用场景,剖析难点和挑战,并给出具备可操作性的解决路径。
演讲提纲:
1. 引论
2. 云原生场景下的稳定性建设的特征分析
3. SLO 驱动的技术风险防控体系
4. 总结展望:SLO 使用的三个阶段
你将获得:
用户中心作为金融系统业务流量的入口,对稳定性和可用性有着极其挑剔的要求,作者通过对流程和规范的治理、架构治理、架构优化等手段大幅度提高了系统的可用性和稳定性,整个过程既有实战落地方案也有指导理论思想,对大多数业务系统的稳定性建设有很好的参考价值。
根据 2008 年 Aberdeen Group 的一份研究报告,对于 Web 网站,1 秒的页面加载延迟相当于减少 11% 的 PV(Page View,页面浏览量),将降低 16% 的顾客满意度。如果出现业务中断,其更可能带来用户流失及其他损失。因此,对于稳定性保障的探索,一直是各大企业努力的方向。在稳保策略上,与故障发生前的系统稳定可靠能力,故障中的容灾恢复能力、事故应急处理能力(流程)息息相关。而其中“防患于未然”的事前能力建设,能相对有效的减少故障发生频率及影响范围,也能为事中的故障处理提供理论支撑,在提升系统健壮性的同时,验证恢复策略的有效性。
本次主要从故障发生前的稳定性建设出发,以一个第三方服务厂商视角进行全链路压测、生产压测、可靠性测试维度的分享。
在大部分企业中,过去的单点工具加人海战术已无法支撑持续交付和高质量交付要求,质量团队需要建设软件全生命周期的质量把控技术能力,有效保障系统的性能、容量及可靠性,特别是在疫情常态化情况下,提升系统整体稳定性。
演讲提纲:
1. 稳定性问题分析
2. 稳定性建设左移三步走
3. 成功案例
你将获得:
这次,我们的整个案例将从十年前的一次生产事件入手,深刻剖析事件发生的来龙去脉:人为的网络错误变更,冲击了冗余网络的备用服务器,回滚后却引发了更严重的重镜像风暴,进而导致控制平面 API 服务失效,无法响应用户请求。不得已采用人为的强制介入,实施隔离、限流和服务降级,历时 12 小时才逐步恢复。事后复盘发现,毒化系统稳定性的刽子手,却来自于经典的主副本链式存储复制方案。
在强一致性的保证下,如何最大程度地减少爆炸半径成为实现高可用性的关键。在数年的韧性工程研究和长期实践基础上,我们摸索出一系列爆炸半径治理的新手段:数据和控制平面的隔离;Cell 架构设计和选型;利用爆炸半径感知驱动的编排策略,平衡可用性、延迟和数据持久性;应用随机分区技术,将用户流量打散在多个 Cell 中,大幅降低爆炸半径;持续创新的 GameDay 实践,提升实际运行效果等等。
演讲提纲:
1. 一次真实生产事件的来龙去脉
2. 事件背后的稳定性问题剖析
3. 十年后我们面临的新挑战
4. 爆炸半径治理实践的新手段
5. 总结和展望
你将获得:



微信咨询

电话咨询
微信联系我们

