随着智能运维快速发展,规模化落地并取得业务收益成为重要话题。本专题将结合AIOp... 展开 >





曲显平,百度云原生和智能运维业务负责人。2009年从复旦大学毕业加入百度,先后负责百度监控、部署、PaaS、智能运维、云原生等方向,构建了百度统一的自动化运维平台和云原生应用平台,提升业务迭代效率,降低运营成本,保障业务高可用和用户体验,其所带领的团队在相关领域顶级会议发表多篇重量级论文和演讲。
随着智能运维快速发展,规模化落地并取得业务收益成为重要话题。本专题将结合AIOps最新技术和落地实践,详细解读AIOps的应用场景、业务痛点、收益、如何落地等宝贵经验,并针对AIOps的发展趋势进行探讨和展望,帮助大家将智能运维规模化落地。
Sunfire 平台作为阿里巴巴集团监控平台,多年以来一直支持和保障着阿里巴巴集团海量技术规模下的业务指标、应用状态及系统资源监控能力,也作为阿里巴巴技术风险体系的前哨和基石,支持了阿里巴巴集团稳定性工作的不断演进。随着阿里集团集群、应用、业务体量的不断扩大,以及集团在稳定性领域的要求不断提升,Sunfire 平台也和阿里经济体的技术体系一同成长和演进。在刚刚过去的2020年双11大促中,Sunfire 平台再次顺利地支持了阿里集团整体的监控和双11应急指挥体系,并显著提升了核心指标监控的时效性和问题发现效率,也在双11之前的生产突袭演练过程中扮演了重要作用。本次演讲,我们会分享这些业务挑战背后的技术思考和实践。
Sunfire 平台也一直保持着在智能监控领域的探索和演进。在已有的智能化时序异常检测算法框架的基础上,为了进一步提升日常及双11大促时的应急故障发现的时效性,我们将时序异常检测算法应用到秒级核心业务指标上,并取得了不错的效果。
本次分享将介绍 Sunfire 平台在秒级业务指标智能监控算法层面的演进和优化。同时,我们也将智能监控的环节从时间序列前置,基于对于应用日志中的错误码的智能监控,我们能够更早更快地发现业务/应用中的错误码异常,也在一定程度上弥补了时序异常检测的监控盲区。本次分享,我们也将分享在错误码异常检测层面的思考和实践。
最后,本次演讲也会分享阿里巴巴集团监控平台在智能监控领域的规划和展望。同时,为了服务更多的云上企业客户,我们也已经将阿里巴巴集团监控平台孵化为面向混合云企业客户的一站式全景监控平台,我们也会简单介绍面向混合云企业客户的监控产品解决方案。
演讲提纲:
你将获得:
随着业务复杂度的上升和微服务架构的兴起,服务的类型和数量越来越多、调用关系越来越复杂,依靠传统的方式去保障服务的稳定性已经远远不能满足需求,稳定性建设面临巨大的挑战。
我们在稳定性建设领域做了很多智能运维的探索,在监控的自动添加、多类型指标的异常检测、告警治理、故障根源原因分析、故障自愈等方面取得了一些进展。另外,在容量管理和成本优化、服务质量评估和技术风险发现等方面都有一些实践,有力的保障了服务稳定性。
演讲大纲:
你将获得:
监控体系建设是 AIOps 落地的重要抓手。监控系统是我们观测业务的窗口,对于业务稳定性而言至关重要。智能故障发现、故障定位、故障自愈等都依赖稳定、可靠、智能的监控系统。本次分享将围绕滴滴的业务场景,详细介绍滴滴智能监控体系建设实践。
演讲提纲:
你将获得:
故障管理是运维的重要场景,是决定业务高可用性的关键,当前很多故障的处理都依赖运维工程师对于监控实时数据的分析,但这个过程其实未必可靠。即使是一个小型分布式系统涉及到数据量也是海量的,故障期间运维工程师也很难综合所有数据进行分析,更多的是依靠历史经验基于局部少量信息做决策,一方面如果历史没见过类似故障,经验不再奏效,故障诊断时间将被拉长,另外一方面,基于局部少量信息做决策往往是不够理性的,可能以错误方式试图恢复故障,更可能造成次生灾害。
因此,我们一直在尝试借助算法对监控系统采集的时序指标和日志文本,并在故障管理场景进行落地,解决一些实际问题。例如故障发现环节如何对于黄金指标进行异常检测?如何降低海量指标的阈值配置成本?故障止损环节如何对常见的单机房故障进行流量自动调度切换?故障诊断环节,如何组合海量多样的数据加速诊断的过程,降低运维工程师的诊断成本?如何通过数据的启发对故障进行预测,使运维工作从救火向防火转变?
本次分享,我们将介绍百度在故障管理的一些经验,并且分别介绍在故障发现、故障止损、故障诊断和故障预测环节的一些智能运维算法探索,最后将分享百度在故障管理场景的一些实践案例。
演讲提纲:
你将获得:



微信咨询

电话咨询
微信联系我们

