AIOps最佳实践

会议室:二号厅B
出品人:曲显平

随着智能运维快速发展,规模化落地并取得业务收益成为重要话题。本专题将结合AIOp... 展开 >

专题出品人:曲显平

百度云原生和智能运维业务负责人

曲显平,百度云原生和智能运维业务负责人。2009年从复旦大学毕业加入百度,先后负责百度监控、部署、PaaS、智能运维、云原生等方向,构建了百度统一的自动化运维平台和云原生应用平台,提升业务迭代效率,降低运营成本,保障业务高可用和用户体验,其所带领的团队在相关领域顶级会议发表多篇重量级论文和演讲。

地点:二号厅B

专题:AIOps最佳实践

随着智能运维快速发展,规模化落地并取得业务收益成为重要话题。本专题将结合AIOps最新技术和落地实践,详细解读AIOps的应用场景、业务痛点、收益、如何落地等宝贵经验,并针对AIOps的发展趋势进行探讨和展望,帮助大家将智能运维规模化落地。

by 王肇刚(梓弋)

阿里巴巴
高级技术专家

Sunfire 平台作为阿里巴巴集团监控平台,多年以来一直支持和保障着阿里巴巴集团海量技术规模下的业务指标、应用状态及系统资源监控能力,也作为阿里巴巴技术风险体系的前哨和基石,支持了阿里巴巴集团稳定性工作的不断演进。随着阿里集团集群、应用、业务体量的不断扩大,以及集团在稳定性领域的要求不断提升,Sunfire 平台也和阿里经济体的技术体系一同成长和演进。在刚刚过去的2020年双11大促中,Sunfire 平台再次顺利地支持了阿里集团整体的监控和双11应急指挥体系,并显著提升了核心指标监控的时效性和问题发现效率,也在双11之前的生产突袭演练过程中扮演了重要作用。本次演讲,我们会分享这些业务挑战背后的技术思考和实践。

Sunfire 平台也一直保持着在智能监控领域的探索和演进。在已有的智能化时序异常检测算法框架的基础上,为了进一步提升日常及双11大促时的应急故障发现的时效性,我们将时序异常检测算法应用到秒级核心业务指标上,并取得了不错的效果。

本次分享将介绍 Sunfire 平台在秒级业务指标智能监控算法层面的演进和优化。同时,我们也将智能监控的环节从时间序列前置,基于对于应用日志中的错误码的智能监控,我们能够更早更快地发现业务/应用中的错误码异常,也在一定程度上弥补了时序异常检测的监控盲区。本次分享,我们也将分享在错误码异常检测层面的思考和实践。

最后,本次演讲也会分享阿里巴巴集团监控平台在智能监控领域的规划和展望。同时,为了服务更多的云上企业客户,我们也已经将阿里巴巴集团监控平台孵化为面向混合云企业客户的一站式全景监控平台,我们也会简单介绍面向混合云企业客户的监控产品解决方案。

演讲提纲:

  1. Sunfire--阿里巴巴双11背后的技术超级英雄
    • 从双11背后的监控挑战
    • 阿里巴巴技术风险&安全生产体系的前锋和基石--Sunfire监控平台
    • 和阿里技术规模一起成长-Sunfire平台架构演进
  2. 智能化监控探索和实践
    • 阿里集团监控平台智能化功能架构
    • 智能监控技术架构演进
    • 秒级智能化监控探索和实践
    • 智能错误码检测--时序异常检测之外的探索和实践
    • 阿里集团监控平台的智能化演进规划
    • 面向混合云企业客户的一站式全景监控平台简介

你将获得:

  1. 学习和了解阿里巴巴集团技术风险业务体系、监控平台技术体系及技术架构演进
  2. 学习和了解阿里巴巴集团双11背后的秒级智能业务指标异常检测技术原理和架构演进
  3. 学习和了解阿里巴巴集团智能错误码异常检测技术原理

by 龚诚

58集团
智能运维团队负责人

随着业务复杂度的上升和微服务架构的兴起,服务的类型和数量越来越多、调用关系越来越复杂,依靠传统的方式去保障服务的稳定性已经远远不能满足需求,稳定性建设面临巨大的挑战。

我们在稳定性建设领域做了很多智能运维的探索,在监控的自动添加、多类型指标的异常检测、告警治理、故障根源原因分析、故障自愈等方面取得了一些进展。另外,在容量管理和成本优化、服务质量评估和技术风险发现等方面都有一些实践,有力的保障了服务稳定性。

演讲大纲:

  1. 稳定性建设与智能运维
  2. 智能监控的全流程闭环
    • 高效的监控全覆盖
    • 多类型指标异常检测
    • 告警治理和告警合并
    • 故障根源原因分析
    • 故障自愈
  3. 容量管理和成本优化
  4. 服务质量评估
  5. 技术风险发现

你将获得:

  1. 学习和了解在稳定性建设领域的智能运维实践经验
  2. 学习和了解在智能监控业务中如何做到全流程闭环
  3. 学习和了解在容量管理和成本优化、服务质量评估和技术风险发现的实践经验

by 艾毅

滴滴出行
高级专家工程师

监控体系建设是 AIOps 落地的重要抓手。监控系统是我们观测业务的窗口,对于业务稳定性而言至关重要。智能故障发现、故障定位、故障自愈等都依赖稳定、可靠、智能的监控系统。本次分享将围绕滴滴的业务场景,详细介绍滴滴智能监控体系建设实践。

演讲提纲:

  1. 智能以数据为本——运维数据资产建设
    • 运维需要关注哪些数据
    • 如何高效灵活的把数据组织起来
    • 数据治理的方式方法:如监控指标治理、监控看板治理、报警策略有效性治理等
  2. 智能以开放为先——最大化发挥数据价值
    • “被集成”:监控系统能力API化,开放监控报警能力,全方位赋能业务
  3. 滴滴监控系统的智能化落地场景
    • 大规模异常检测算法实践
    • 根因定位
    • 故障自愈
    • 自动巡检
  4. 案例:滴滴国际化业务监控体系建设实践
  5. 未来规划:开源开放,赋能行业——滴滴夜莺智能监控系统简介

你将获得:

  1. 了解滴滴如何系统化、体系化的构建智能高效的监控体系
  2. 了解滴滴的实时计算平台建设经验
  3. 了解大规模智能异常检测算法实践经验

by 陈云

百度
资深研发工程师

故障管理是运维的重要场景,是决定业务高可用性的关键,当前很多故障的处理都依赖运维工程师对于监控实时数据的分析,但这个过程其实未必可靠。即使是一个小型分布式系统涉及到数据量也是海量的,故障期间运维工程师也很难综合所有数据进行分析,更多的是依靠历史经验基于局部少量信息做决策,一方面如果历史没见过类似故障,经验不再奏效,故障诊断时间将被拉长,另外一方面,基于局部少量信息做决策往往是不够理性的,可能以错误方式试图恢复故障,更可能造成次生灾害。

因此,我们一直在尝试借助算法对监控系统采集的时序指标和日志文本,并在故障管理场景进行落地,解决一些实际问题。例如故障发现环节如何对于黄金指标进行异常检测?如何降低海量指标的阈值配置成本?故障止损环节如何对常见的单机房故障进行流量自动调度切换?故障诊断环节,如何组合海量多样的数据加速诊断的过程,降低运维工程师的诊断成本?如何通过数据的启发对故障进行预测,使运维工作从救火向防火转变?

本次分享,我们将介绍百度在故障管理的一些经验,并且分别介绍在故障发现、故障止损、故障诊断和故障预测环节的一些智能运维算法探索,最后将分享百度在故障管理场景的一些实践案例。

演讲提纲:

  1. 百度运维平台历史
  2. 智能运维的意义和基础
  3. 故障管理场景
    • 故障管理场景模型
    • 故障管理场景痛点
  4.  故障管理场景的 AIOps 探索
    • 故障发现:黄金指标异常检测算法
    • 故障止损:单机房止损
    • 故障诊断
    • 故障预测

你将获得:

  1. 了解百度的运维平台发展历史,对于智能运维算法的理解和实施要素
  2. 了解百度在故障管理场景遇到的难点问题、智能运维算法思想和落地案例
  3. 了解百度在故障预测环节的具体实践和未来工作思路

交通指南

北京国际会议中心

Beijing International Convention Center
地址:北京市朝阳区北辰东路7号
  • 微信咨询

  • 电话咨询

    联系电话:+86 17310043226

微信联系我们

小姐姐