云原生时代的可观测最佳实践

会议室:大宴会厅 1
出品人:周小帆(承嗣)

以容器化、微服务为代表的云原生技术是一把“双刃剑”,既带... 展开 >

专题出品人:周小帆(承嗣)

阿里云资深技术专家

目前就职于阿里云云原生应用平台,负责阿里集团 APM 系统鹰眼(EagleEye)与阿里云应用实时监控服务(ARMS)等技术产品。在可观测相关领域有超过九年的实战经历,对分布式链路追踪、日志处理平台和监控告警系统的建设与应用有丰富经验。其他技术相关的经验包含微服务治理、分布式数据处理、应用 PaaS 等。

地点:大宴会厅 1

专题:云原生时代的可观测最佳实践

以容器化、微服务为代表的云原生技术是一把“双刃剑”,既带来了极致的弹性与快捷的研发效率,同时也引入了更高的架构复杂度与更为繁重的运维负担。

好的可观测性是驾驭这把双刃剑的唯一手段。近年来,企业在可观测性能力建设上的投入不断加大;同时,伴随着云原生技术的兴起,与之对应的各类开源与商业化可观测软件产品也层出不穷。如何根据企业自身特点,将各类可观测技术与业务场景有机结合,助力企业更好地实现业务连续性、高效问题定位诊断、大规模成本优化、安全防控体系建设,逐渐成为大家密切关注的话题。

本专题将邀请可观测以及其辐射领域的一线专家,介绍典型行业在云原生技术场景下对于可观测技术的落地案例与最佳实践。

by 黄杰

腾讯
技术专家

随着微服务架构的逐渐普及,服务的可观测性越来越被重视。Metric、Logging、Tracing 作为可观测性的三大组成部分,在腾讯各个业务场景以及合作伙伴的业务中都有非常广泛的应用。本次演讲将分享万亿甚至十万亿级的数据量级下,腾讯在云原生可观测领域的思考与实践。

演讲提纲:

1. 鉴古知今:10 年前的 QQ 是如何实现可观测的?

  • QQ 后台监控体系
    • 即时通信软件后台整体架构
    • 消息的可靠性如何监控?
    • 多终端消息一致性如何监控?
    • 群消息 Pull Or Push?监控系统来出招
    • 跨地域,跨机房,跨运营商的自动化收发消息探测
  • Monitor 系统架构解析

2. 腾讯可观测系统发展史

  • 变与不变:从单体系统监控到微服务可观测,变化在哪里
    • 数据量爆发式增长:从 Schema On Read 到 Schema On Write
    • 计算与存储分离:从 Map-Reduce 到实时流处理
    • 协议标准化:从私有协议(模调)到开源分布式追踪协议
  • 拥抱云原生:协议对齐开源 OpenTelemetry,后台架构升级

3. 海量监控数据实时处理

  • 背景:云上监控数据的爆发式增长
  • 接入层高可用:日均 10 万亿+数据接入层架构设计
  • 快慢分离:延时数据处理
  • 采样的艺术:SDK 延时采样与Flink尾部采样
  • Schema On Write:级联计算性能优化

4. 可观测系统存储层架构设计

  • 背景:越来越多元化的查询场景需要异构存储,单一存储无法满足功能和性能
  • 统一查询协议:Query Engine 架构介绍
  • 追求极致:ElasticSearch 在时序数据场景的优化
  • 异构存储:Metric、Logging、Tracing多场景下的存储优化方案 

5. 总结与展望

  • 案例分享
  • 未来的技术挑战
    • 告警规则更灵活,告警检测性能要求更高
    • 更大的数据规模,更高的流处理实时性要求
    • 更灵活的数据查询性能(内存级时序数据库)

你将获得:

  • 了解腾讯可观测系统发展历史以及未来的发展趋势
  • 了解腾讯在可观测领域的技术实践
  • 了解腾讯监控数据实时处理架构设计
  • 了解腾讯可观测系统存储引擎架构设计

by 张柳青

百度
资深研发工程师

Prometheus 作为云原生时代指标监控的事实标准已经深入人心,其优秀的指标数据模型、强大的查询分析能力以及丰富的周边生态支持,让监控变的更加便捷易用。

但在业界常见的实践案例中,更多是介绍如何做基础的 Kubernetes、主机、中间件监控。而对于大型互联网、金融等行业,则会更加关注交易/请求量、成功率、响应时间等业务层指标监控,同时基于细分业务维度进行细粒度的故障发现与定位。这就对监控系统提出了大规模高性能、计算报警低延迟、数据高可靠、平台高可用多方面要求,对常见的 Prometheus 解决方案带来巨大挑战。

本次演讲将介绍百度云原生团队是如何针对互联网、金融等行业大规模业务监控的需求,构建基于 Prometheus 的高性能、高可用解决方案。

演讲提纲:

1. 大规模业务监控在 Prometheus 架构中遇到的挑战

  • 业务监控在 Prometheus 中的落地场景
  • 大规模业务监控在 Prometheus 架构下的挑战
    • 大规模数据量级带来的数据采集与存储压力
    • 大规模数据计算与报警带来的性能与时延问题
    • 数据高可靠与平台高可用挑战
  • 原生 Prometheus 的解决方法与存在的问题

2. 针对业务监控场景的高性能、高可用的 Prometheus 监控方案实践

  • 高性能 Prometheus 架构实践
    • 基于主动探测的探测任务负载均衡
    • “降维打击”业务指标降维预聚合方案
    • 高性能流式计算与报警引擎
    • 时序存储降采样与高性能缓存实现方法
  • 数据高可靠与平台高可用方案
    • 采集层高可用容灾架构
    • 计算与存储的数据高可靠保障
    • 两地三中心高可用保障
  • 在 Prometheus 应用中踩过的坑
  • PromQL 算子带来的数据丢点与准确性问题

3. 总结与展望

  • Prometheus 在业务监控应用中前景与优势

你将获得:

  • 加深对 Prometheus 整体架构实现原理的理解
  • 了解针对大规模监控场景下,构建高性能、高可用 Prometheus 解决方案的思路和方法
  • 了解 Prometheus 生产应用中存在的坑,以及如何解决

by 向阳

云杉网络
研发 VP

随着越来越多的应用采用云原生架构,可观测性的关注程度急剧上升,成为业界讨论的云原生热点话题。但实际在落地可观测性的过程中,会发现开发人员需要付出很多建设工作,埋点、插码、改造 RPC 框架,乃至因为可观测性需求影响到业务架构的技术选型。几乎同时成为热点的,还包括以零侵扰特性著称的 eBPF 技术,但大家谈论更多的是 eBPF 技术本身,苦恼的是它对于内核版本的需求,以及将它落地到生产环境的技术掌控难度,如何利用它的优势降低可观测性建设的成本,目前还没有好的实践总结。

刚刚开源的 DeepFlow 是一个高度自动化的可观测性协作平台,它背后的企业版产品已有多年的云原生环境实战沉淀。DeepFlow 深度使用 eBPF 技术,十四年来首次实现了对分布式追踪技术的重大创新,极大的降低了开发者的埋点插码负担,并通过集成 OpenTelemetry 数据消除了云原生环境下的追踪盲点。此外,通过对 cBPF 的灵活使用,DeepFlow 支持对任意编程语言、任意开发框架的全栈应用性能指标采集,且避免了 eBPF 对内核版本的依赖。本次分享将深度解密 DeepFlow 基于 eBPF 的可观测性能力建设。

演讲提纲:

1. 分布式追踪:回顾十四年历史,剖析云原生时代的新痛点

  • 分布式追踪:从 Dapper 到 Skywalking 到 OpenTelemetry 的历史
  • 云原生时代,微服务拆分越来越细,应用插码总是插不全
  • 云原生时代,服务之间的链路越来越复杂,链路追踪总是追不全

2. AutoTracing:DeepFlow 基于 eBPF 之上的颠覆性创新

  • 以 Istio Bookinfo Demo 为例演示 DeepFlow 高度自动化的分布式追踪能力
  • AutoTracing 背后的关键技术洞察:内核线程模型
  • 实现 AutoTracing 的六大挑战:线程复用、NIO/AIO、跨线程、调用追踪、HTTP 追踪、构造火焰图

3. 让追踪无盲点:全栈、全链路,利用创新技术的最佳实践

  • 集成 OpenTelemetry 数据消除云原生环境下的追踪盲点,让 AutoTracing 发挥最大价值
  • 以 Spring Boot Demo 为例演示 DeepFlow 的无盲点追踪能力
  • 无盲点追踪激活团队协同,让运营、开发、运维在一个频道上对话

4. 展望未来:开源共建,开启高度自动化的可观测性新时代

  • DeepFlow:高度自动化的可观测性协同平台
  • 基于 cBPF 的 AutoMetrics、AutoLogging 全栈应用性能指标、应用访问日志能力
  • AutoTagging + SmartEncoding:10x 性能、自动标签注入,规范化所有可观测数据
  • 作为使用者,最小代价落地 DeepFlow
  • 作为贡献者,参与 eBPF 在可观测性的最佳实践

听众收益:

  • 深度了解如何利用 eBPF 实现颠覆性的零插码全栈分布式追踪
  • 了解如何利用 cBPF 避免 eBPF 对内核的依赖,自动采集应用性能指标和访问日志
  • 了解如何最小代价使用 DeepFlow
  • 了解如何参与 DeepFlow 开源社区

by 徐彤(绍宽)

阿里巴巴
高级技术专家

云原生时代,借助日趋成熟的容器化与中间件技术,企业应用的形态也随之演进迭代、但是研发运维人员更替,层级过深且异构的技术栈、自下而上野蛮生长、缺少统一管控的研发体系,都为后续整体业务架构的稳定性、成本、演进效率带来了沉重的负担。本话题将结合企业在不同发展时期,三个真实的案例,和听众探讨企业对可观测的诉求是如何影响云原生可观测发展以及在发展过程中可观测难点与最佳实践。

演讲提纲:
1. 云原生发展带来给可观测带来哪些新变化
2. 三个案例讲述可观测发展之路

  • 企业上云催生可观测一体化、自动化
  • 企业成本控制、开源战略带来可观测二次变革
    • 可观测是一门数据存储的生意?
    • 开源和商业化产品水火不容?
  • 企业出海驱动可观测全球化、智能化

3. 展望未来:面对下一代云原生可观测架构,我们将如何进行准备

你将获得:

  • 了解阿里云在不同时期做出的可观测趋势判断
  • 了解不同企业画像下的可观测诉求
  • 了解可观测的未来发展趋势

交通指南

北京·四季酒店

Beijing International Convention Center
地址:北京市朝阳区亮马桥路48号
  • 微信咨询

  • 电话咨询

    联系电话:+86 15600537884

微信联系我们

小姐姐