刘凯宁,蚂蚁集团 SRE 技术专家,毕业于中南大学。有丰富的业务稳定性保障经验,深度参与过容量、资源、压测、限流、预案、监控、应急、变更、资金安全、容灾演练等领域的业务布防和能力建设,多次参与超大型活动的稳定性保障,承担过大促保障队长、全链路压测负责人、全链路资源容量负责人、全链路资金安全保障负责人等角色
线上故障到底是什么?谁应该为线上稳定性负责?如何评价应急过程到底是做的好还是不好?
近年来国内外多家知名公司都出现过重大故障,线上可靠性变得越来越重要,同时由于不同公司的主营业务、企业性质、公司规模等差异较大,稳定性保障思路和落地方案也是百花齐放。但有一些最核心、最本质的问题还是急需被定义和讨论清楚。
本次分享主要介绍蚂蚁的故障应急体系,通过实际的故障案例来简要介绍故障定义、组织阵型、平台能力、应急流程、应急评价等内容,并分享 AIOPS、LLM 大模型等能力在应急定位中的落地情况,以期能够回答业务稳定性保障要“做什么”、“谁来做”、“怎么算做得好”等问题,希望能给大家带来一些新的保障思路。
演讲提纲
1. 引子:一个真实的线上故障
2. 蚂蚁故障体系构建
3. 蚂蚁应急体系构建
4. 一个线上故障的全生命周期
5. 未来已来
实践痛点
演讲亮点
听众收益



微信咨询

电话咨询
微信联系我们

