稳定性建设

会议室:苏黎世 1
出品人:丁雪丰

我们差点挂了!本专题将邀请一线专家分享宝贵的故障复盘及稳定性建设经验。

... 展开 >

专题出品人:丁雪丰

美团金融服务平台研究员

丁雪丰,美团金融服务平台研究员,极客时间《玩转 Spring 全家桶》课程讲师,腾讯云最具价值专家。活跃的技术图书作译者,出版了《Spring Boot 实战》、《RESTful WebService Cookbook 中文版》等 8 部图书,致力于推动优秀技术在国内的发展。

地点:苏黎世 1

专题:稳定性建设

我们差点挂了!本专题将邀请一线专家分享宝贵的故障复盘及稳定性建设经验。

by 丁乾

蚂蚁集团
高级技术专家

本次分享围绕蚂蚁基础设施 SRE 团队在云原生架构的演进过程中的的稳定性建设,复盘真实的生产故障案例,探讨在云原生的时代的技术风险防控策略。针对 SRE 的经典方法论之一的 SLO 体系,对于其在云原生场景的构建、扩展和运营,将结合真实的使用场景,剖析难点和挑战,并给出具备可操作性的解决路径。

演讲提纲:

1. 引论

  • 真实故障场景分享
  • 回顾经典的技术风险防控体系建设
    • 事前/事中/事后

2. 云原生场景下的稳定性建设的特征分析

  • 分布式系统的大量使用和业务增长带来的问题
  • 云厂商/云服务的使用对底层基础设施的冲击

3. SLO 驱动的技术风险防控体系

  • 经典概念对齐以及扩展概念引入
  • 结合真实故障的使用案例分享 SLO 数据建设
  • SLO 运营思路和潜在误区
    • 实践并验证过的有效运营手段分享,例如预警、定位、大盘等
    • 公示、文档等强运营流程在稳定性建设中的作用
    • 误区:不要把 SLO 当作传统监控使用

4. 总结展望:SLO 使用的三个阶段

你将获得:

  • 了解 SLO 驱动的稳定性建设的使用场景以及其对应的优势
  • 了解 SLO 体系构建过程中的困难挑战以及对应的解决思路
  • 了解云原生场景下的稳定性建设的可行思路和优化手段

 

by 田垅

平安银行
高级研发经理

用户中心作为金融系统业务流量的入口,对稳定性和可用性有着极其挑剔的要求,作者通过对流程和规范的治理、架构治理、架构优化等手段大幅度提高了系统的可用性和稳定性,整个过程既有实战落地方案也有指导理论思想,对大多数业务系统的稳定性建设有很好的参考价值。

by 杨靖

PerfMa
解决方案专家

根据 2008 年 Aberdeen Group 的一份研究报告,对于 Web 网站,1 秒的页面加载延迟相当于减少 11% 的 PV(Page View,页面浏览量),将降低 16% 的顾客满意度。如果出现业务中断,其更可能带来用户流失及其他损失。因此,对于稳定性保障的探索,一直是各大企业努力的方向。在稳保策略上,与故障发生前的系统稳定可靠能力,故障中的容灾恢复能力、事故应急处理能力(流程)息息相关。而其中“防患于未然”的事前能力建设,能相对有效的减少故障发生频率及影响范围,也能为事中的故障处理提供理论支撑,在提升系统健壮性的同时,验证恢复策略的有效性。

本次主要从故障发生前的稳定性建设出发,以一个第三方服务厂商视角进行全链路压测、生产压测、可靠性测试维度的分享。

在大部分企业中,过去的单点工具加人海战术已无法支撑持续交付和高质量交付要求,质量团队需要建设软件全生命周期的质量把控技术能力,有效保障系统的性能、容量及可靠性,特别是在疫情常态化情况下,提升系统整体稳定性。

演讲提纲:

1. 稳定性问题分析

  • 生产故障无处不在
  • 稳定性保障的内/外部要求
  • 从故障根因看稳定性风险
  • 信通院的“稳保行动”建议演练方案

2. 稳定性建设左移三步走

  • GBT25000 系统与软件质量模型的定义
  • 全链路压测
    • 与过去压测的区别
    • 基于全链路的问题定位方法
    • 常态化回归机制建设
  • 全链路生产压测
    • 从传统测试中突围
    • 全链路生产压测关键技术
    • 识别生产压测风险项
    • 实施组织与配合
    • 生压测执行流程规范
  • 可靠性测试建设
    • 主动强化
    • 风险项示例
    • 风险项巡检流程
    • 强弱依赖风险演练示例

3. 成功案例

  • 如何协助企业建设全链路压测体系

你将获得:

  • 了解故障发生前的系统稳定可靠能力建设的基本思路:不断寻找从性能-容量-可靠性的相对分母,并通过不同的测试方法和手段进行持续的覆盖
  • 了解全链路压测下的根因分析方案,深度质量分析,提升性能表现
  • 了解容量评估的全链路生产压测方案,评估真实容量
  • 了解可靠性测试方案,提升系统容错率
  • 了解第三方产商服务视角的体系建设过程

by 黄帅

亚马逊云科技
资深技术专家兼安全团队主管

这次,我们的整个案例将从十年前的一次生产事件入手,深刻剖析事件发生的来龙去脉:人为的网络错误变更,冲击了冗余网络的备用服务器,回滚后却引发了更严重的重镜像风暴,进而导致控制平面 API 服务失效,无法响应用户请求。不得已采用人为的强制介入,实施隔离、限流和服务降级,历时 12 小时才逐步恢复。事后复盘发现,毒化系统稳定性的刽子手,却来自于经典的主副本链式存储复制方案。

在强一致性的保证下,如何最大程度地减少爆炸半径成为实现高可用性的关键。在数年的韧性工程研究和长期实践基础上,我们摸索出一系列爆炸半径治理的新手段:数据和控制平面的隔离;Cell 架构设计和选型;利用爆炸半径感知驱动的编排策略,平衡可用性、延迟和数据持久性;应用随机分区技术,将用户流量打散在多个 Cell 中,大幅降低爆炸半径;持续创新的 GameDay 实践,提升实际运行效果等等。

演讲提纲:

1. 一次真实生产事件的来龙去脉

  • 十年前人为变更错误
  • 回滚后的重镜像风暴
  • 控制平面毒化和失效
  • 隔离限流和服务降级
  • 恢复过程和事件影响

2. 事件背后的稳定性问题剖析

  • 数据和控制平面分析
  • 脆弱的分布式配置服务
  • 配置服务上的 CAP 困境

3. 十年后我们面临的新挑战

  • 无解的故障宿命论
  • 稳定性测试的新难点
  • 爆炸半径管控的新思路

4. 爆炸半径治理实践的新手段

  • 韧性工程的引入
  • 数据和控制平面隔离
  • Cell 架构设计和选型
  • 爆炸半径感知的编排策略
  • 随机分区技术
  • GameDay 实践

5. 总结和展望

你将获得:

  • 复盘一次真实生产事件的来龙去脉
  • 剖析经典稳定性方案上遇到的新问题和关键的技术难点
  • 了解现实分布式架构设计中,平衡强一致性、高可用性和低延迟性能的新方法
  • 针对分布式系统,了解爆炸半径治理实践的多种新手段

交通指南

上海·宏安瑞士大酒店

Swissotel Grand Shanghai
地址:上海市静安区愚园路1号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

小姐姐 瑞丽