加速与反哺:AI 时代的可观测实践

会议室:兴盛宴会厅
出品人:张城

随着云原生、多云架构、大语言模型(LLM)的爆发式发展,企业系统复杂度呈指数级增... 展开 >

专题出品人:张城

阿里云可观测技术架构负责人,高级技术专家

阿里云可观测技术架构负责人,高级技术专家,在可观测数据采集、存储分析、全栈可观测应用、AIOps 等多个领域均有丰富领导经验,相关系统历经数十万企业以及阿里内部多次双十一考验。目前主要研究方向为大模型可观测及应用、AIOps、下一代可观测数据技术。

地点:兴盛宴会厅

专题:加速与反哺:AI 时代的可观测实践

随着云原生、多云架构、大语言模型(LLM)的爆发式发展,企业系统复杂度呈指数级增长,传统可观测技术面临海量数据实时分析、跨模态数据整合、问题发现即时度、根因定位效率等挑战。与此同时,LLM 的推理能力与生成式 AI 的数据理解能力,为可观测技术(尤其是 AIOps )的演进提供了全新思路。另一方面,可观测技术也在反哺 AI 领域:模型训练需要可观测性保障资源效率与稳定性,LLM 应用落地依赖实时监控以优化性能与用户体验。

本专题将围绕 AI 与可观测技术的双向赋能,讨论如下方面的问题:

  • LLM 如何重构传统可观测数据采集、分析、可视化、异常检测、根因定位全链路
  • AIOps 从实验到生产、从口号到落地的行动路径
  • 可观测对 AI 全生命周期的支撑:从模型训练、推理以及 LLM 应用的稳定性保证与优化
  • AIOps 和 LLM 可观测需求对可观测数据平台的要求如何,平台自身如何演进

通过本专题探讨,希望为听众带来以下核心价值:

  • 技术前沿:了解 AI 时代可观测技术的最新趋势
  • 实践经验:获取 AIOps 规模化落地、大模型可观测等关键策略
  • 通用可观测:从传统可观测延伸,构建“观测-分析-行动”的通用智能闭环

 

by 李也 博士

阿里云
算法专家

大模型 Agent 在智能运维场景落地时常常遇到“做 demo 容易,泛化难”的问题。借鉴编程智能体中可验证环境的成功经验,我们构建了智能运维领域的可验证实验环境和高质量评测集。阿里云可观测团队对云原生应用的运行态进行了详尽的理论建模,构建了覆盖 APM/容器/云服务/操作系统/LLM 应用等领域的实验环境,设计了全面的故障注入机制,并在此基础上制作了大规模高质量的评测集。

本次分享我将介绍这个实验环境并发布评测集,深入探讨如何利用评测集验证并提升基于 Agent 的智能运维算法泛化性。

演讲提纲

1. 智能运维泛化之痛

  • 传统的基于规则的智能运维难泛化
  • 受限于基础大模型能力限制,基于 Prompt Engineering 和大模型 Workflow 的智能运维在泛化性上也会遇到瓶颈
  • 用大模型 Agent 做 demo 容易,上生产难

2. 智能运维领域的评测集介绍

  • 评测集的规模:数据量级与场景多样性
  • 评测集的覆盖度:跨领域的全面性

3. 如何构建高质量的评测集

  • 在解决智能运维场景泛化性问题之前,我们需要想清楚要泛化到哪些场景
    • 对智能运维 Agent 评测问题的理论建模——把问题边界想清楚
  • 实验环境的架构设计和实现
  • 构建评测集过程中踩过的坑与经验教训

4. 基于评测集的智能运维 Agent 能力提升实践

  • 如何用评测集验证智能运维 Agent 的泛化性及其可信度
  • 阿里云智能运维 Agent 在评测集上的表现
  • 如何用实验环境和评测集提升智能运维 Agent 的泛化性

您认为,这样的技术在实践过程中有哪些痛点?

  • 对系统状态的建模和故障注入的覆盖度有一定的假设

演讲亮点

  • 工程实践:阿里云可观测团队构建 AIOps 评测集的技术实践
  • 方法论创新:把问题想清楚——关于如何构建评测集覆盖尽可能多真实问题的深度思考
  • 实战指南:如何用评测集验证并提升智能运维 Agent 的泛化性

听众收益

  • 了解一个可以用于验证并提升智能运维 Agent 泛化性的高质量评测集
  • 掌握如何用高质量评测集提升 Agent 泛化性的方法
  • 获得构建企业级 AIOps 评测体系的实践经验

by 郭刚平

字节跳动
研发工程师

近年来,AI 技术发展迅猛,相关产品和解决方案已深入社会经济的方方面面,成为驱动创新、提升效率的重要引擎,AI 应用的其可观测技术也成为了行业关注的一个焦点,Prometheus 作为云原生监控领域事实标准,被广泛应用于 AI 大模型和智能驾驶领域的可观测任务,用于实现最佳性能及减少故障。本次演讲我将分享火山引擎托管 Prometheus 在服务 AI 领域客户(如火山方舟)过程中,积累的保障 AI 推理服务时序数据库稳定性的关键技术实践,希望能给听众带来一些启发和思考。

演讲提纲

1. 大模型场景指标观测需求和挑战

  • 推理训练场景指标大规模高基数问题
    • 方舟大量接入点带来十亿级别的时序基数
    • 自动驾驶云大量短时训练任务引起高基数
    • 单指标高基数导致大查询
  • 在线推理服务扩缩容调度需求
  • 流量高峰需要快速扩容对查询可用性的要求
    • K8s 基础的 HPA 不满足要求,需要基于 GPU 等自定义指标来作为扩缩容依据
  • 推理服务流量亲和性调度对指标实时性的要求
    • 大流量租户 Qos 保障需求
    • 写入链路
      • 网关共享集群导致的租户间写入相互影响
    • 查询链路
      • 单一租户大查询影响同一集群下的其他租户可用性

2. 新时代下 Prometheus 核心演进思路

  • 端到端稳定性保障
    • 集群粒度、租户粒度、查询粒度
  • 写入水平扩展、统一聚合查询,支撑大规模数据量
  • 原地数据分析 & AIOps 数据探查
  • 大规模场景下大模型的监控架构

3. 火山引擎托管 Prometheus 优化实践

  • 高基数问题
    • 高流失率高基数时序场景下的短时查询优化
    • 查询预聚合降低基数
    • 与业务侧对齐打点最佳实践方案
  • 在线推理调度对指标可用性&实时性的需求
    • 近用户集群侧实时指标缓存
  • 大流量租户 Qos 保障
    • 写入链路
      • 大流量租户网关自动拆分独立分组
    • 查询链路
      • 大查询发现和治理
      • 面向" Never OOM "的查询组件设计
      • Shuffle Sharding 查询
    • 聚合工作区 突破单集群规模上限
      • Sharding 写入 & 聚合查询

4. 大模型场景实战效果

  • 稳定支撑火山引擎方舟十亿级时序读写,实现业务零改造低成本水平扩展
  • 近集群侧实时指标,助力在线推理服务 TTFT 延迟降低 40%

5. 未来与展望

  • 更高性能、更低成本的下一代时序存储
  • Inplace 时序数据分析能力
  • AIOps 能力内外复用上云

实践痛点

  • 时序的高基数问题是个持续易反复的问题,因为生产端是不受控的,如何在保障系统稳定性的前提下尽最大努力保障用户的可用性和体验是一个持久战,不仅仅是技术层面,也需要用户侧的宣贯和配套的基础建设来减少不合理使用姿势

听众受益

  • 了解端到端构建稳定的监控方案
  • 了解大规模场景下大模型的监控架构实践
  • 了解 Prometheus 创新性技术落地

by 鲜嘉麒

快手
商业化稳定性架构负责人

短视频平台自然流量与广告流量的传输链路,存在链路长、跨时序、在离线架构的特点,研发苦于“捋不清业务”、“看不清链路”,广告曝光与转化链路的异常归因复杂度极高,传统运维面临业务指标与系统链路脱节的核心瓶颈。通过 AI 驱动,构建了快手电商、商业化和本地业务的公司级链路可观测平台。基于报文异动巡检、数据异动巡检、指标拓扑巡检的行业创新的链路巡检工具,实现百维字段组合归因与千亿级报文的多 LoRA 高效微调。本次分享我将系统分享数据壁垒破解路径与模型幻觉的准召率取舍逻辑,沉淀从报文分析到决策博弈的多个关键场景实战经验,为行业提供经过千亿级流量验证的可观测技术落地经验参考。

演讲提纲

1. 广告曝光与转化链路的复杂性与问题排查难度

  • 业务科普:广告链路的流量特点与数据生产流程
  • 系统特点:业务指标异常与系统链路之间的脱节
  • 难点分析:长链路、跨时序、在离线架构的问题分析复杂度

2. 从人工梳理到模型生成,公司级业务链路的梳理落地方案

  • 从人工梳理到自动生成:如何逐步实现离线架构与异步链路的可视化
  • 链路层次设计:如何打通业务链路和系统链路的桥接
  • 系统链路保鲜:如何低成本运营链路梳理并且保证质量
  • 链路异常巡检:如何通过PMTL智能分析链路异常

3. 通过大模型进一步提高链路问题召回质量

  • 业务 & 系统指标拓扑在根因定位中的决策价值
    • 运用链路图反向生成指标拓扑的创新实践与坑点
    • 从业务指标到系统指标的下钻归因:理想与现实的突破
  • 报文异动告警在链路问题中的分析价值
    • 运用报文辅助分析业务异常与兜底监控
    • 运用报文对错误码字段分布异动的探查、错误码自动释义分析
    • 运用报文对业务字段分布异动的探查
    • 脉冲场景下通过模型时序算法优化告警阈值
  • 数据异动告警在链路问题中的分析价值
    • 自动探查数据表字段的分布异动与归因
    • 广告收入问题上百维度的多字段组合自动归因实现

4. 经验总结与建议

  • AI 当下还不是银弹,多推荐,少决策,我们做了哪些取舍
  • 千亿级报文数据下的多 LoRA 高效微调试点到上线经验总结

您认为,这样的技术在实践过程中有哪些痛点?

  • 如何打通企业内部的数据壁垒,实现代码、监控数据、业务表的全环节打通
  • 模型幻觉在告警归因决策上的取舍,准召率视角下,要准还是要召

演讲亮点

  • 可复制性经验:从企业落地性的角度,科学且真实地描绘全景可观测技术在 AI 背景下的公司级落地经验,具有复制和参考价值
  • 实战踩坑总结:实践过程中的每一步都体现了理想与现实的博弈,生动讲解在特定情境下如何权衡取舍

听众收益

  • 了解快手当前在监控与快速恢复领域的 AI 实践场景,包含可借鉴的案例与实战经验
  • 了解广告链路的业务概念、系统实现细节,以及如何基于AI提升运维质量
  • 了解实战中的大规模报文、数据指标的数据准备与训练经验

by 董善东 博士

字节跳动
Dev-Infra 观测平台算法负责人

研发与 SRE 团队日常工作中,主要被三类任务消耗大量时间:半夜因告警被叫醒、反复查询指标日志及排障分析、撰写复盘总结报告。传统自动化及 AIOps 实践虽然在一定程度上缓解了部分环节的问题,但由于知识难以结构化复用、工具体系分散,导致难以有效融合多源观测数据与专家知识,且难以泛化应用于多样化场景。我们提出基于大语言模型(LLM)的“ 告警值守 SRE Agent”,实现告警降噪自动处理、微服务根因定位与个性化分析,最终生成值守报告,显著提升运维效率。

演讲提纲

1. 告警值守场景的痛点、挑战和 Agent 的价值

  • 值守场景的痛点与挑战
  • 尽管引入智能检测,告警噪音问题依然严重影响值守效率
  • AIOps 虽解决了标准化微服务的根因分析(RCA)问题,但面对自定义分析需求存在瓶颈
  • 如何将用户个性化排查知识加载成可执行的分析模型?
  • 如何高效闭环实现“发现-分析-处理-预防”流程?
  • 引入 Agent 后, 可以解决哪些问题

2. 搭建 SRE Agent, 遇到的三大挑战

  • Prompt 与上下文信息日益增长,导致 Token 数量爆炸,影响模型性能
  • 代码逐渐演变为复杂 Workflow,面临效果与泛化能力的权衡
  • Agent 目前仅能执行简单 SOP,复杂个性化排查经验难以复用

3. SRE Agent 平台架构的“四横四纵”设计

  • 四横维度:观测数据层 / LLM 与知识引擎 / Agent 运行架构 / SRE Agent 应用场景
  • 四纵流程:Plan(规划)- Act(执行)- Assess(评估)- Learn(学习)

4. 初步实践:基于 Agent 的告警降噪实现

  • 噪音告警的定义、判定标准及处理流程
  • 基于历史对话与处理记录的知识提取与经验学习机制
  • 典型场景案例分析

5. “5A”行动计划:从 RCA Copilot 到自主分析与行动适应 Agent

  • Analyze & Plan:通过问题分析、规划思路、计划生成等多种方式,增强复杂 SOP 的规划能力
  • Act:采用 Plan-Executor 拆解机制,实现执行器解耦,提升复杂 SOP 执行效率
  • Adapt:引入记忆模板机制,提高相似问题的复用率
  • 典型场景案例分析

6. 总结与展望

  • Agent 在告警值守场景中的实践经验与教训总结
  • 面向未来,构建具备自主规划与迭代能力的“运维数字生命体”

您认为,这样的技术在实践过程中有哪些痛点?

  • Agent 如何与观测平台中多样化环境和数据源无缝打通,获取完整上下文信息
  • Workflow 与 Agent 之间的权衡,如何平衡确定性执行与探索可能性
  • 如何构建数据驱动与学习驱动的双轮机制,使每次执行成功经验沉淀为可复用的增长引擎

演讲亮点

  • 规模化场景与探索上限并存:结合噪音告警识别与个性化 SOP 执行,探讨告警值守场景的两种技术路径
  • 踩坑经验与架构创新:深入剖析 Agent 架构优化与演进历程,分享 Workflow 与 Agent 之间的设计权衡与取舍

听众收益

  • 全面了解字节跳动内部从 0 到 1 构建 SRE Agent 的实践历程
  • 深入理解知识提取与学习机制在噪音告警治理中的应用
  • 掌握通过 Plan-Act 循环提升复杂 SOP 执行能力的方法,解决自定义与个性化排障经验沉淀与执行难题

by 徐建伟

bilibili
可观测平台研发负责人

在支撑 bilibili 亿级用户的复杂分布式系统中,一次故障可能涉及数百个微服务的连锁反应。传统的人工排查方式面临着"大海捞针"的困境,平均 MTTR 往往在小时级别。而 AI 技术的突破为这一问题带来了全新解法。我们构建了智能化根因分析系统,实现了从"被动响应"到"主动诊断"的转变,将工程师从重复性排查工作中解放出来。本次分享我将深入剖析 bilibili 在 AI 驱动的智能运维领域的核心技术实践,包括多模态数据融合、知识图谱构建、大模型推理优化等关键技术,为听众提供可落地的 AI + 可观测性解决方案。

演讲提纲

1. 从"人肉排查"到"AI诊断":bilibili 的痛点与机遇

  • 亿级用户背景下的故障挑战:复杂度指数级增长
  • 传统根因分析的三大瓶颈:时间成本、准确率、知识传承
  • AI 技术带来的机遇:数据驱动 + 智能推理

2. 根因分析核心架构和演进思路

  • 多模态数据融合:日志、指标、链路、事件的统一建模
  • 知识图谱构建:从历史案例到智能推理规则
  • 大模型应用:自然语言处理 + 时序分析的深度融合
  • 数据提纯:清洗、对齐、增强 —— 打造高信噪比的诊断燃料
  • 模型迭代:动态调整推理边界,让 AI 学会“灰度思考”
  • 工单即训练集:每一次人工复盘都是模型的进化机会
  • 自生长的知识库:诊断结果自动沉淀为可复用的解决方案

3. 核心场景的 AI 化改造实践

  • 视频播放异常:从告警到根因定位的 3 分钟闭环
  • 推荐系统降级:多组件级联故障的智能溯源
  • 局部流量暴增:多元数据联动诊断
  • 数据库性能:SQL 慢查询的智能优化建设

4. 技术演进方向与实践展望

  • 场景覆盖的扩展:降低用户领域知识到根因模型的转化门槛
  • 准确率的持续提升:从问题定界向精准定根因的技术深化
  • AI 能力的平台化:构建可复制、可扩展的智能诊断体系

您认为,这样的技术在实践过程中有哪些痛点?

 

  • 特定业务逻辑场景覆盖不足(如风控限流导致互动主播无法查看到观众弹幕)
  • 定制化业务规则适配成本较高(需人工配置策略,购买任务配置过期)
  • 复杂业务场景的根因定位准确率待提升(典型如联合会员兑换未到账问题)

演讲亮点

  • 通过建立业务场景模型与底层多模态数据的深度关联,实现了从业务指标异常(如流量下跌)到系统组件(如风险控制模块)、基础设施(如 IP 发布策略)的全链路根因追溯能力。这种端到端的关联分析有效解决了传统监控中"指标孤岛"问题,使故障定位时间缩短 60% 以上
  • 将传统权重分析升级为基于知识图谱的因果推理模型,通过细粒度条件过滤机制(如结合发布时间窗口、IP 批次等维度),实现了多维因子交叉影响的自动化分析。实际测试表明,该方法使误报率降低 45%,准确率提升至 92%

听众收益

  • 系统性理解分布式场景下的根因分析挑战
    • 掌握复杂系统中根因定位的典型难点(如微服务间非线性交互、数据割裂、术语差异等),明确从“表象告警”到“真实根因”的推理障碍
    • 学习如何通过多源数据融合(日志、指标、链路等)和知识库构建解决信息缺失与噪声问题
  • 获得可落地的根因分析方法论与实践经验
    • 了解从告警触发到自动化归因的完整演进路径,包括模型优化(如边界条件细化)、案例沉淀(工单联动生成知识库)等关键步骤
    • 直接复用分享中的典型场景解决方案(如 SLA 异常、MySQL 慢查询突增),快速定位类似问题(如资源争抢、发布故障)

by 王亚普

小红书
可观测团队负责人

AI 技术的爆发式增长对可观测性的挑战和新需求:如何保障 AI Infra 和 AI 应用的稳定性、性能和可靠性,可观测平台也从“服务业务”到“服务 AI ”再到“自身智能化”的演进趋势。AI 正在重塑可观测平台的能力边界:需要对 AI 基础设施、训练/推理有一定了解,才能提供真正有效的可观测能力;从传统的数据呈现/检索工具,变成具备洞察力和决策辅助能力的智能系统。本次分享我会结合小红书在 AI 领域不同方向解决痛点问题的经验探索,详细分享其中一些重点技术的实践和落地,希望能给听众带来一些启发和思考,欢迎多多交流。

演讲提纲

1. 小红书可观测在 AI 时代面临的挑战

2. AI Infra 观测:稳定性体系建设

  • 业务痛点以及对 AI Infra 稳定性的要求
  • GPU 基础设施保障:解决算力故障的资源浪费问题
  • 训练任务的稳定性保障:训练 Hang 的发现与定位、训练效果观测
  • 业务实战案例分享

3. AI 应用观测:全链路监控的落地实践

  • AI 应用的快速发展对可观测基建的挑战
  • AI 应用全链路监控的解决方案
  • 业务实战案例分享

4. 可观测 AI Agent 场景建设与落地

  • 围绕稳定性工程的 AI + 建设思路
  • 可观测 AI + 架构设计
  • 最佳实践分享

5. 未来规划

您认为,这样的技术在实践过程中有哪些痛点?

  • 环境异构挑战:内部训练框架多元、GPU 品牌参数与型号参差不齐,难以制定一套兼顾所有场景的通用解决方案
  • 在千卡甚至万卡集群训练时,任务 Hang 住所有 Pod 表现都是卡死,故障种类较多且故障定位的工作非常复杂
  • AI 应用的全链路追踪对于现有基建存在很多兼容性的挑战,需要考虑现状和业界发展趋势找到合适的落地路径

演讲亮点

  • GPU 故障诊断、训练 Hang 故障发现与定位可复制的工程经验
  • 可观测 AI Agent 产品化落地的思路,融合传统 AIOps 能力与大模型的落地实践

听众收益

  • 了解大规模训练过程中 Hang 的问题发现和自动化诊断
  • 了解业务 AI 应用端到端链路监控的建设思路
  • 了解 AI + 可观测的产品设计思路和技术架构

by 马千里

小米
可观测团队负责人

随着服务架构的演进,可观测性解决方案也在持续发展。在分布式系统可观测性技术还未完全成熟时,大模型的兴起又对可观测性提出了新的技术要求,并催生了创新的实践方法。本次演讲我将首先回顾小米可观测性技术的发展历程,随后深入分享可观测性在 AI 基础设施建设中的多项解决方案与实践案例,包括集群快速交付、多机房高可用架构、网络监控与故障自愈等关键技术领域的应用实践。

演讲提纲

1. 现状与挑战

  • 完整的可观测体系建设
  • 集群自动化交付
  • 多机房可用性保障
  • 不同领域的数据联动

2. 可观测在 AI 基础设施的落地方案

  • 能力概览
  • 典型案例-大模型场景
  • 典型案例-高性能网络场景

3. AIOps 探索落地

  • 从高频场景触发
  • 基于 MCP 的多 Agent 实现
  • 落地效果

4. 展望

  • 深化能力
  • 泛化场景

您认为,这样的技术在实践过程中有哪些痛点?

  • 业务场景多,业务敏感,对服务质量提出更高要求
  • 架构日益复杂,对服务可用性的保障机制提出更高要求
  • 服务规模大,数据量大,成本增加,需要长期在质量和成本之间平衡

演讲亮点

  • 可观测性服务自身的自动化运维方案
  • 大模型服务日志的持久化方案
  • 网络故障监控与自愈方案

听众收益

  • 了解可观测系统的演进历程
  • 了解可观测性在 AI 基建中的典型案例

交通指南

上海浦东滨江喜来登酒店

SHERATON SHANGHAI PUDONG RIVERSIDE
地址:上海浦东大道2288号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手