2014 年 6 月于北京理工大学取得计算机硕士学位,现任百度资深研发工程师,加入百度后一直从事 AIOps 算法与架构方面的工作,致力于黄金指标异常检测体系、AIOps 前沿算法研究与落地、新一代报警系统等相关工作。

2014 年 6 月于北京理工大学取得计算机硕士学位,现任百度资深研发工程师,加入百度后一直从事 AIOps 算法与架构方面的工作,致力于黄金指标异常检测体系、AIOps 前沿算法研究与落地、新一代报警系统等相关工作。
故障管理是运维的重要场景,是决定业务高可用性的关键,当前很多故障的处理都依赖运维工程师对于监控实时数据的分析,但这个过程其实未必可靠。即使是一个小型分布式系统涉及到数据量也是海量的,故障期间运维工程师也很难综合所有数据进行分析,更多的是依靠历史经验基于局部少量信息做决策,一方面如果历史没见过类似故障,经验不再奏效,故障诊断时间将被拉长,另外一方面,基于局部少量信息做决策往往是不够理性的,可能以错误方式试图恢复故障,更可能造成次生灾害。
因此,我们一直在尝试借助算法对监控系统采集的时序指标和日志文本,并在故障管理场景进行落地,解决一些实际问题。例如故障发现环节如何对于黄金指标进行异常检测?如何降低海量指标的阈值配置成本?故障止损环节如何对常见的单机房故障进行流量自动调度切换?故障诊断环节,如何组合海量多样的数据加速诊断的过程,降低运维工程师的诊断成本?如何通过数据的启发对故障进行预测,使运维工作从救火向防火转变?
本次分享,我们将介绍百度在故障管理的一些经验,并且分别介绍在故障发现、故障止损、故障诊断和故障预测环节的一些智能运维算法探索,最后将分享百度在故障管理场景的一些实践案例。
1. 百度运维平台历史
2. 智能运维的意义和基础
3. 故障管理场景
4. 故障管理场景的AIOps探索



微信咨询

电话咨询
微信联系我们

