在软件研发领域拥有 15 年架构设计、分布式系统稳定性建设、安全运维以及团队管理经验,自 2018 年以来推动亚马逊全球混沌工程服务落地,混沌狨书《混沌工程:复杂系统韧性实现之道》》合译者,目前是亚马逊云科技专业服务部资深技术专家兼安全团队主管。
这次,我们的整个案例将从十年前的一次生产事件入手,深刻剖析事件发生的来龙去脉:人为的网络错误变更,冲击了冗余网络的备用服务器,回滚后却引发了更严重的重镜像风暴,进而导致控制平面 API 服务失效,无法响应用户请求。不得已采用人为的强制介入,实施隔离、限流和服务降级,历时 12 小时才逐步恢复。事后复盘发现,毒化系统稳定性的刽子手,却来自于经典的主副本链式存储复制方案。
在强一致性的保证下,如何最大程度地减少爆炸半径成为实现高可用性的关键。在数年的韧性工程研究和长期实践基础上,我们摸索出一系列爆炸半径治理的新手段:数据和控制平面的隔离;Cell 架构设计和选型;利用爆炸半径感知驱动的编排策略,平衡可用性、延迟和数据持久性;应用随机分区技术,将用户流量打散在多个 Cell 中,大幅降低爆炸半径;持续创新的 GameDay 实践,提升实际运行效果等等。
演讲提纲:
1. 一次真实生产事件的来龙去脉
2. 事件背后的稳定性问题剖析
3. 十年后我们面临的新挑战
4. 爆炸半径治理实践的新手段
5. 总结和展望
你将获得:



微信咨询

电话咨询
微信联系我们

