随着数据(Data)+算法(AI)驱动运维理念的发展,“可观测性&r... 展开 >





周琦(简志),阿里云资深技术专家,负责阿里集团/蚂蚁金服/阿里云日志处理、分析平台。周琦早年参与阿里云飞天操作系统从无0到1研发,对大规模系统监控诊断、性能分析有非常多的经验。目前负责的产品阿里云日志服务 SLS 每天处理万级用户,十几 PB 日志类数据(Metric、Tracing、Log)分析类任务,服务整个阿里集团+各大知名互联网公司。对 AIOps 领域的数据处理、建模、异常检测、故障诊断、知识图谱等有实践经验,正推进在业务场景的落地。
随着数据(Data)+算法(AI)驱动运维理念的发展,“可观测性”技术在云原生领域快速发展,成为各大公司监控/运维技术演进的风向标。“可观测性”技术借助于多种类、全方位的可观测数据,让繁重的问题发现、分析、定位过程更加简单和高效,并朝着让机器管理机器愿景逐渐迈进。
此外,万物皆可度量的理念也带着“可观测性”技术在成本管理、用户增长、安全风控、研发效能等领域逐步落地,诞生了很多经典案例。本专题主要探讨可观测性相关技术以及在各领域落地的最佳实践。
随着云计算、微服务和分布式系统的普及,新的应用程序往往被设计和构建在云上运行。尽管这提供了构建更具弹性、性能更好和更安全的应用程序的新策略,但它带来了对支持这些工作负载的基础架构失去控制的潜在成本。需要设计和构建应用程序以包含和促进使某些实体可以观察它们的机制,这就是云原生可观测性。
本次分享主要介绍腾讯在可观测性标准以及技术等方面的思考与落地实践。
演讲提纲:
1. 云原生可观测性概述
2. 可观测性技术标准化
3. 可观测性数据模型及技术原理
4. 腾讯可观测性落地实践
5. 总结与展望
你将获得:
随着微服务、云原生、容器编排、DevOps 等新一代技术的出现,传统的监控已经很难适应如今复杂的业务系统,因此可观察性的概念开始被各大公司争相追捧。本次分享主要介绍阿里在可观察性问题上的思考,如何从底层存储引擎做起,全面支撑 PB 级 Logs、Metrics、Traces 各类可观察性数据的统一存储、分析与应用。
演讲提纲:
1. 可观察性的前世今生
2. 阿里对于可观察性问题的思考
3. 可观察性统一数据引擎方案设计
4. 总结与展望
你将获得:
⽹络连接的可观测性在互联⽹数据中⼼中⾮常重要,包括业务上下游的调⽤关系、实时流量,数据中⼼跨节点的实时流量和拥塞情况,特殊场景下,还需要额外关注如丢包、延迟、流量异常等。在⽹络异常的定位的过程中,我们期望能快速定位到受影响范围和根因,为业务运维提供有效⽀持,降低损失。
Bytemap 是字节跳动内基于主机⽹络监控数据打造的数据中⼼⽹络可观测平台,为各业务侧、及数据中⼼整体的⽹络基础设施提供多维度的⽹络质量监控。在具体实现上,我们通过主机内核的 eBPF 采集机制来获取基于连接层⾯细粒度的内核⽹络监控指标,通过实时数仓储存数据和对接流式分析平台。在产品层,我们通过与应⽤、主机的监控指标串联形成统⼀的监控产品。同时通过API和数据消费的形式,为多种运维场景提供⽀持。系统上线两年多时间运⾏稳定,多次为业务排障、业务流量容量规划预估提供了完备的数据⽀持,并且与多个运维场景相结合,解决其他场景中遇到的痛点问题,发挥价值。
演讲提纲:
1. 问题背景
2. 解决思路
3. ⼯程实践
4. 未来展望
你将获得:
随着业务规模的发展,美团监控体系经历了多次的升级迭代,从早期的工具化到如今一体化全栈监控,已发展成为面向基础设施和应用程序(包括应用端、Web 前端以及移动端等)的立体式监控服务,实现全栈监控的统一解决方案和信息汇聚。
如今云原生技术的兴起,企业内部开始逐步转型上云。云原生可观测性概念的提出,对传统监控系统提出了更高的要求,需要对 Metric、Log、Trace 数据以及多个领域之间进行串联打通,并做数据分析决策。可观测性体系建设,将有助于跟踪、了解和诊断生产环境问题,辅助开发和运维人员快速发现、定位和解决问题,支撑风险追溯、经验沉淀、故障预警,提升系统可靠性。
演讲提纲:
1. 监控体系介绍
2. 监控体系建设
3. 可观测性建设
4. 总结与展望
你将获得:



微信咨询

电话咨询
微信联系我们

