抢回 50% 的值班时间:字节跳动 SRE Agent 从 0 到 1 的降噪与排障实践

所属专题:加速与反哺:AI 时代的可观测实践

嘉宾 : 董善东 博士 | 字节跳动Dev-Infra 观测平台算法负责人

会议室 : 兴盛宴会厅

讲师介绍

专题演讲嘉宾:董善东 博士

字节跳动Dev-Infra 观测平台算法负责人

深耕 AIOps & 可观测行业多年, 在异常检测、根因分析、Agent 应用等领域有比较深入的行业认知和产品功能 Build 经验。 曾就职于腾讯云、阿里云。

议题介绍

演讲:抢回 50% 的值班时间:字节跳动 SRE Agent 从 0 到 1 的降噪与排障实践

研发与 SRE 团队日常工作中,主要被三类任务消耗大量时间:半夜因告警被叫醒、反复查询指标日志及排障分析、撰写复盘总结报告。传统自动化及 AIOps 实践虽然在一定程度上缓解了部分环节的问题,但由于知识难以结构化复用、工具体系分散,导致难以有效融合多源观测数据与专家知识,且难以泛化应用于多样化场景。我们提出基于大语言模型(LLM)的“ 告警值守 SRE Agent”,实现告警降噪自动处理、微服务根因定位与个性化分析,最终生成值守报告,显著提升运维效率。

演讲提纲

1. 告警值守场景的痛点、挑战和 Agent 的价值

  • 值守场景的痛点与挑战
  • 尽管引入智能检测,告警噪音问题依然严重影响值守效率
  • AIOps 虽解决了标准化微服务的根因分析(RCA)问题,但面对自定义分析需求存在瓶颈
  • 如何将用户个性化排查知识加载成可执行的分析模型?
  • 如何高效闭环实现“发现-分析-处理-预防”流程?
  • 引入 Agent 后, 可以解决哪些问题

2. 搭建 SRE Agent, 遇到的三大挑战

  • Prompt 与上下文信息日益增长,导致 Token 数量爆炸,影响模型性能
  • 代码逐渐演变为复杂 Workflow,面临效果与泛化能力的权衡
  • Agent 目前仅能执行简单 SOP,复杂个性化排查经验难以复用

3. SRE Agent 平台架构的“四横四纵”设计

  • 四横维度:观测数据层 / LLM 与知识引擎 / Agent 运行架构 / SRE Agent 应用场景
  • 四纵流程:Plan(规划)- Act(执行)- Assess(评估)- Learn(学习)

4. 初步实践:基于 Agent 的告警降噪实现

  • 噪音告警的定义、判定标准及处理流程
  • 基于历史对话与处理记录的知识提取与经验学习机制
  • 典型场景案例分析

5. “5A”行动计划:从 RCA Copilot 到自主分析与行动适应 Agent

  • Analyze & Plan:通过问题分析、规划思路、计划生成等多种方式,增强复杂 SOP 的规划能力
  • Act:采用 Plan-Executor 拆解机制,实现执行器解耦,提升复杂 SOP 执行效率
  • Adapt:引入记忆模板机制,提高相似问题的复用率
  • 典型场景案例分析

6. 总结与展望

  • Agent 在告警值守场景中的实践经验与教训总结
  • 面向未来,构建具备自主规划与迭代能力的“运维数字生命体”

您认为,这样的技术在实践过程中有哪些痛点?

  • Agent 如何与观测平台中多样化环境和数据源无缝打通,获取完整上下文信息
  • Workflow 与 Agent 之间的权衡,如何平衡确定性执行与探索可能性
  • 如何构建数据驱动与学习驱动的双轮机制,使每次执行成功经验沉淀为可复用的增长引擎

演讲亮点

  • 规模化场景与探索上限并存:结合噪音告警识别与个性化 SOP 执行,探讨告警值守场景的两种技术路径
  • 踩坑经验与架构创新:深入剖析 Agent 架构优化与演进历程,分享 Workflow 与 Agent 之间的设计权衡与取舍

听众收益

  • 全面了解字节跳动内部从 0 到 1 构建 SRE Agent 的实践历程
  • 深入理解知识提取与学习机制在噪音告警治理中的应用
  • 掌握通过 Plan-Act 循环提升复杂 SOP 执行能力的方法,解决自定义与个性化排障经验沉淀与执行难题

交通指南

上海浦东滨江喜来登酒店

SHERATON SHANGHAI PUDONG RIVERSIDE
地址:上海浦东大道2288号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手