全景全栈可观测性实践

会议室:汉宫+明宫
出品人:凌志钧

可观测性是当今 IT 领域最热门的话题之一,Gartner 将其列为 &ldqu... 展开 >

专题出品人:凌志钧

字节跳动云原生可观测负责人

凌志钧,同济大学计算机系硕士,具有超过 15 年的互联网分布式系统研发和架构经验。曾就职于 eBay、 Paypal 参与 & 负责 私有云 和风控机器学习平台建设。先后负责字节跳动基础架构研发部门,负责智能运维方向,包括海量时序数据库、日志生态、分布式调用链路和可观测平台以及火山引擎观测产品研发。

地点:汉宫+明宫

专题:全景全栈可观测性实践

可观测性是当今 IT 领域最热门的话题之一,Gartner 将其列为 “2023 年度企业十大重要战略技术趋势”之一,并指出可观测性可以帮助企业实现数据价值最大化、加速企业数字化转型。随着云计算普及、移动互联网应用普及、LLM 大模型如火如荼地发展,可观测实践在各行各业的应用愈发广泛,提升企业排障和运维效率。

本专题旨在介绍各种观测场景下的前沿发展,包括埋点技术、客户端以及服务端应用性能分析、观测产品表达等、深入剖析其在不同企业的成功应用案例,总结可复制的经验与模式,并为更多企业采纳借鉴可观测方案提供明确的指引。

我们将探讨如下问题:

  • 可观测埋点方案有哪些新趋势?

  • 各厂商如何结合自身业务需求和特点来选择对应的观测产品表达?

  • 在成本、稳定性、易用性、安全性等方面,各厂商如何取舍,并达成观测技术和业务目标?

通过本专题,期望能让听众及时掌握可观测的前沿动态,拓宽技术视野。从众多企业成功案例中汲取灵感,并能内化到自身的业务观测应用中,进而在许多其他行业的 IT 系统稳定性运行保驾护航。

by 王涛

字节跳动
APMPlus Android 负责人

在客户端产品日益复杂的背景下,如何全面监控客户端用户体验,实现对异常场景的有效归因,并全面提升用户体验,是客户端可观测性面临的主要挑战。本次分享将介绍字节跳动在 Android 客户端可观测性建设中的最佳实践,包括如何从用户体验出发确定关键指标和优先级,探讨不同性能监控的底层实现逻辑,并分享一些实际的异常优化案例及其具体效果。

演讲提纲

1. 字节 Android 客户端的可观测指标

  • 探讨 Android 客户端中有哪些可观测性能指标
  • 重点介绍各个指标在用户体验中的重要性和优先级

2. 可观测指标归因的底层原理

  • 详细解析可观测性指标归因的基本原理和实现方法
  • 分享如何通过归因分析找出性能问题的根本原因

3. Android性能优化的最佳实践

  • 介绍内存 OOM 优化、CPU 异常优化等具体案例
  • 分享实际项目中的优化策略和具体效果

4. 当前的挑战和未来的规划

  • 分析当前在 Android 性能监控和优化领域所面临的主要挑战
  • 展望未来的发展方向和技术规划

您认为,这样的技术在实践过程中有哪些痛点?

  • 线上监控方案客户端的性能损耗和有效归因如何平衡
  • Anr等深度长尾问题的解决和异常高效自动化归因如何进一步探索

演讲亮点

  • 内存监控高效的内存裁剪技术,数百 M 的内存文件通过裁剪压缩平均大小只有二三十 M
  • CPU 监控,自设计的火焰图高效定位线程高 CPU 消耗的异常问题

听众收益

  • 了解字节跳动如何监控 Android 性能稳定性
  • 了解字节跳动一些有效的 Android 性能优化方案
  • 了解客户端监控后续的一些挑战和规划

by 刘正峰

小红书
资深工程师

随着云原生、微服务等技术的广泛应用,可观测的重要性得到广泛认可。云原生和微服务技术的不断深入应用,也给可观测提出了新的需求。在常见的 Metrics、Logging、Tracing 等传统可观测范畴外,需要持续探索新的技术和方案。

本次演讲将介绍小红书可观测团队对eBPF等新技术在可观测领域的实践经验,在通用流量分析、持续 Profiling 等应用场景下进行落地。该技术方案在小红书多个核心业务线上大规模、常态化的运行,如推荐、搜索、广告、存储等业务线。

演讲提纲

1. 背景和挑战

  • 小红书可观测实践中遇到的新问题

2. eBPF 在通用流量分析中的应用

  • 整体架构设计
  • eBPF 内核态 & 用户态的设计
  • 数据的处理、指标生成和存储
  • 查询能力极致优化
  • 落地案例分享

3. eBPF 在持续 Profiling 中的应用

  • 整体架构设计
  • eBPF 内核态&用户态的设计
  • 性能数据持续采集 & 处理 & 优化
  • 性能数据存储和使用
  • 落地案例分享

4. 总结与展望

  • 更多的产品形态
  • 在 LLM 应用上的持续探索

您认为,这样的技术在实践过程中有哪些痛点?

  • eBPF 技术的大规模常态化运行,往往对内核版本是有要求的;在不同的内核版本上,需要做一定的适配和微调

演讲亮点

  • 真正实现了在核心系统上大规模、常态化的运行
  • 落地过程中,依赖多种可观测能力,促进了可观测能力的优化和融合

听众收益

  • 在传统的可观测领域之外,如何持续进行新的探索
  • 了解 eBPF 在大规模常态化运行中的经验

by 夏明

阿里云
高级技术专家

随着 DeepSeek-V3 & R1 火爆全球,基于大语言模型和 AI 生态技术栈构建的应用与业务场景与日俱增。AI 原生应用架构从研发到生产落地,面临诸多新的挑战,包括模型选择、流程编排、评估分析等等。可观测技术可以帮助 LLM 应用开发及运维人员更好的优化模型性能、成本及效果。

本次演讲将以 DeepSeek 对话机器人为例,深入介绍 AI 原生应用架构的可观测需求、挑战与方案实践。比如 DeepSeek 为何频繁出现服务器繁忙?如何评估 DeepSeek 与其他模型的性能、成本与效果差异?如何优化 DeepSeek 对话机器人的终端用户体验?等等。希望能给听众带来一些思考和参考。

演讲提纲

1. AI 原生应用架构演进与落地挑战

  • 蓬勃发展的 AI 应用生态
  • 微服务应用架构 vs AI 原生应用架构
  • 典型的 LLM 应用观测需求与挑战

2. AI 原生应用架构可观测方案

  • 面向 LLM 应用的领域化 Trace 语义
    • User -> Session -> Trace -> Span
    • LLM Span Kind/Attributes
  • 面向 LLM 应用的领域化指标洞察
    • 系统、模型、失败、延迟、成本、评估
  • 基于 OpenTelemetry 的高质量数据采集
    • 大模型框架无侵入埋点(vLLM)
    • 如何解决超长文本采集与分析
  • LLM 专属领域可视化分析视图
    • 推理性能分析
    • Token消耗分析
    • LLM TraceView

3. DeepSeek 对话机器人可观测实践

  • 如何构建端到端全链路分析视图?
    • 前端、网关、后端、模型、基础设施
  • 如何解决海量并发下的服务器繁忙?
    • 瓶颈定位、请求缓存、模型切换等
  • 如何评估对话机器人回答效果?
    • 向量索引、语义富化、效果评估等

您认为,这样的技术在实践过程中有哪些痛点?

  • 大模型领域化数据语义、采集、加工与可视化
  • 大模型端到端全栈数据打通与分析
  • 从性能向成本、评估效果的观测重心转移

演讲亮点

  • 面向 AI 原生应用的端到端全栈可观测方案
  • 以 DeepSeek 对话机器人为例,介绍大模型调用性能/成本/效果优化实践

听众收益

  • 了解阿里云面向 AI 原生应用架构的全栈可观测前沿技术
  • 开拓新思路,比如通过 LLM Trace 分析 DeepSeek 对话机器人服务器繁忙性能瓶颈

by 王辉

快手
客户端架构师

在大时长应用的可观测性中,超长且复杂的链路是一个重要的体现。长链路归因是流量领域的常见挑战之一,小到订单路径大到流量拆分,从算法的内容策略归因到资源成本分摊,都高度依赖于长链路埋点基建。长链路归因强依赖埋点透传机制,那么在客户端如何界定透传的业务架构与平台架构的边界?新的埋点标准如何在保持统一性的同时提高效率?面对众多存量场景导致的高替换成本,以及增量业务迭代的不收敛,如何实现存量与增量的全面覆盖?这些问题都是解决长链路归因埋点问题时需要权衡的典型问题。在本次分享中,我将基于在快手牵头长链路埋点标准建设、数据治理及架构建设的经验,与大家深入探讨这些问题。

演讲提纲

1.  超长路径带来的关键问题

  • 大时长意味着超长路径
  • 关键问题1:长路径归因问题(面向分析师)
  • 关键问题2:算法内容归因问题(面向算法)
  • 关键问题3:故障定位问题(面向研发)

2. 可观测体系构建

  • 横向组织阵型建设:用委员会机制凝聚共识,科学推进
  • 规范化建设及治理:有效的问题分类、分级,保障基建高效彻底落地
  • 平台化建设:通过自动化、自助化实现极值的埋点、应用效率

3. 长路径归因解法实践

  • URT 染色:用自动化透传机制解决长路径订单归因问题
  • STID 策略 ID:用多通道透传机制,解决内容分发、算法归因问题
  • 相关性变更归因:在 80% 故障场景下,用相关性归因替代 Trace 归因

4. 总结与展望

  • 推进效果及反思
  • 未来展望,更全面的落地,更高的效率

您认为,这样的技术在实践过程中有哪些痛点?

  • 破旧立新 vs. 在问题中演进。由于数据消费的复杂性,我们采用的是快速演进的方式,演进中逐步替代老基建。
  • 新标准如何在可控成本下进行增量覆盖及存量替代。我们采取的是基于现有架构对不同业务形态提出不同的收敛架构,从而实现存量平滑覆盖及增量需求卡口。
  • 高精度 vs. 成本可控。动辄万亿条级别的数据,我们选择的是基于应用场景等级进行不同级别采样的方案。

演讲亮点

  • 统一的长链路埋点架构,让业务团队不再关注透传需求,透传机制及质量保障由 SDK 负责,从而实现效率和质量的双重保障。
  • 新型归因平台,覆盖线上80%的故障,提供了分钟级归因定位能力,为移动端故障止损提供了基础支撑。

听众收益

通过收听本次演讲,您将至少在以下方面了解到我们最新的探索进展及收获:

  • 在埋点领域,搭建自动化长链路机制,并且兼顾分析师、算法、研发多种决策的归因诉求等方面的建设经验。
  • 在排障领域,移动端如何用变更归因架构替代Trace机制,从而获得更好的精度及时效性的建设经验。

交通指南

北京石景山万达嘉华酒店

Wanda Jin
地址:北京市石景山区石景山路甲18号院
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手