蚂蚁故障应急全流程体系构建及应用实践

所属专题:线上可靠性工程

嘉宾 : 刘凯宁 | 蚂蚁集团 SRE 技术专家

会议室 : 钻石厅C

讲师介绍

专题演讲嘉宾:刘凯宁

蚂蚁集团 SRE 技术专家

刘凯宁,蚂蚁集团 SRE 技术专家,毕业于中南大学。有丰富的业务稳定性保障经验,深度参与过容量、资源、压测、限流、预案、监控、应急、变更、资金安全、容灾演练等领域的业务布防和能力建设,多次参与超大型活动的稳定性保障,承担过大促保障队长、全链路压测负责人、全链路资源容量负责人、全链路资金安全保障负责人等角色

议题介绍

演讲:蚂蚁故障应急全流程体系构建及应用实践

线上故障到底是什么?谁应该为线上稳定性负责?如何评价应急过程到底是做的好还是不好?

近年来国内外多家知名公司都出现过重大故障,线上可靠性变得越来越重要,同时由于不同公司的主营业务、企业性质、公司规模等差异较大,稳定性保障思路和落地方案也是百花齐放。但有一些最核心、最本质的问题还是急需被定义和讨论清楚。

本次分享主要介绍蚂蚁的故障应急体系,通过实际的故障案例来简要介绍故障定义、组织阵型、平台能力、应急流程、应急评价等内容,并分享 AIOPS、LLM 大模型等能力在应急定位中的落地情况,以期能够回答业务稳定性保障要“做什么”、“谁来做”、“怎么算做得好”等问题,希望能给大家带来一些新的保障思路。

演讲提纲

1. 引子:一个真实的线上故障

  • 是怎么发现的?
  • 是怎么定位根因的?
  • 是怎么止血的?
  • 是怎么复盘的?

2. 蚂蚁故障体系构建

  • 故障的定义、分类,以及对应的平台能力和评价指标
  • 故障数据如何驱动日常稳定性保障工作的开展和能力演进

3. 蚂蚁应急体系构建

  • 应急的目标和各阶段的数据指标定义,组织阵型设计和对应的评价指标
  • 应急各阶段的目标和平台能力支撑

4. 一个线上故障的全生命周期

  • 从故障定义、故障注入、故障发生、故障发现、故障响应、故障定位、故障止血、故障复盘全生命周期进行详细的分析,并尽可能多的展示实践效果

5. 未来已来

  • AIOPS 助力应急定位快速发现故障原因的方法
  • 通过 LLM 加速故障复盘及 ACtion 跟进

实践痛点

  1. SRE 团队与开发团队、质量团队在稳定性保障事项中的目标、分工、合作方式,会因各公司的组织结构差异而有非常大的不同,在落地的过程中难免会有一些冲突
  2. 故障应急的根因定位能力非常依赖公司的基础设施基建,AIOPS 和 LLM 在落地的过程中会不可避免的遇到定位准确率低、定位结果方差大的问题

演讲亮点

  • 以业务稳定为中心的、以风险事件及线上故障数据为驱动的、以 SRE 能力提升和平台能力演进为路径的技术风险整体防控方案
  • AI 大模型在应急根因定位、应急快恢决策、应急 Action 跟踪等方面的能力实践和未来展望

听众收益

  • 了解蚂蚁集团风险事件和线上故障管理的设计思路及现有能力
  • 了解蚂蚁集团应急全流程的设计思路、平台能力、机制流程
  • 了解典型故障应急的全流程应对及处理方案
  • 探索 AI 大模型能力如何落地到故障应急领域

交通指南

上海中谷小南国花园酒店

China Grain Hotel
地址:上海市杨浦区佳木斯路777号(近营口路口)
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手