研发与 SRE 团队日常工作中,主要被三类任务消耗大量时间:半夜因告警被叫醒、反复查询指标日志及排障分析、撰写复盘总结报告。传统自动化及 AIOps 实践虽然在一定程度上缓解了部分环节的问题,但由于知识难以结构化复用、工具体系分散,导致难以有效融合多源观测数据与专家知识,且难以泛化应用于多样化场景。我们提出基于大语言模型(LLM)的“ 告警值守 SRE Agent”,实现告警降噪自动处理、微服务根因定位与个性化分析,最终生成值守报告,显著提升运维效率。
演讲提纲
1. 告警值守场景的痛点、挑战和 Agent 的价值
- 值守场景的痛点与挑战
- 尽管引入智能检测,告警噪音问题依然严重影响值守效率
- AIOps 虽解决了标准化微服务的根因分析(RCA)问题,但面对自定义分析需求存在瓶颈
- 如何将用户个性化排查知识加载成可执行的分析模型?
- 如何高效闭环实现“发现-分析-处理-预防”流程?
- 引入 Agent 后, 可以解决哪些问题
2. 搭建 SRE Agent, 遇到的三大挑战
- Prompt 与上下文信息日益增长,导致 Token 数量爆炸,影响模型性能
- 代码逐渐演变为复杂 Workflow,面临效果与泛化能力的权衡
- Agent 目前仅能执行简单 SOP,复杂个性化排查经验难以复用
3. SRE Agent 平台架构的“四横四纵”设计
- 四横维度:观测数据层 / LLM 与知识引擎 / Agent 运行架构 / SRE Agent 应用场景
- 四纵流程:Plan(规划)- Act(执行)- Assess(评估)- Learn(学习)
4. 初步实践:基于 Agent 的告警降噪实现
- 噪音告警的定义、判定标准及处理流程
- 基于历史对话与处理记录的知识提取与经验学习机制
- 典型场景案例分析
5. “5A”行动计划:从 RCA Copilot 到自主分析与行动适应 Agent
- Analyze & Plan:通过问题分析、规划思路、计划生成等多种方式,增强复杂 SOP 的规划能力
- Act:采用 Plan-Executor 拆解机制,实现执行器解耦,提升复杂 SOP 执行效率
- Adapt:引入记忆模板机制,提高相似问题的复用率
- 典型场景案例分析
6. 总结与展望
- Agent 在告警值守场景中的实践经验与教训总结
- 面向未来,构建具备自主规划与迭代能力的“运维数字生命体”
您认为,这样的技术在实践过程中有哪些痛点?
- Agent 如何与观测平台中多样化环境和数据源无缝打通,获取完整上下文信息
- Workflow 与 Agent 之间的权衡,如何平衡确定性执行与探索可能性
- 如何构建数据驱动与学习驱动的双轮机制,使每次执行成功经验沉淀为可复用的增长引擎
演讲亮点
- 规模化场景与探索上限并存:结合噪音告警识别与个性化 SOP 执行,探讨告警值守场景的两种技术路径
- 踩坑经验与架构创新:深入剖析 Agent 架构优化与演进历程,分享 Workflow 与 Agent 之间的设计权衡与取舍
听众收益
- 全面了解字节跳动内部从 0 到 1 构建 SRE Agent 的实践历程
- 深入理解知识提取与学习机制在噪音告警治理中的应用
- 掌握通过 Plan-Act 循环提升复杂 SOP 执行能力的方法,解决自定义与个性化排障经验沉淀与执行难题