在面对庞大复杂的业务系统中,传统的自动化排障方案往往依赖于人工预定义的静态 SOP,对于未知/深层故障时力不从心。本次分享将介绍快手主站通用排障 AI Agent 实践 —— Eureka!。我们放弃了静态编排模式,转而采用 Plan/RePlan + ReAct 的 MultiAgent 范式组成 Agent Team,在部分场景下取得超越人类专家的推理效果。LLM 通过自主生成排查假设、动态调用自描述工具、结合数据资产沉淀进行深度推理,同时将验证有效的逻辑沉淀为可复用的智能资产。我将从业务视角出发,在核心业务指标下跌等极具复杂和挑战的真实案例下,深入探讨如何构建一个能召回、可解释、自进化的 RCA Agent 系统。
演讲提纲
1. 复杂业务场景下的排障困局与范式转变
- 从静态 SOP 到动态推理: 传统的规则引擎或 Worlflow 应对复杂业务的复合故障、未知/深层故障时的局限性与挑战
- 面向Agent的核心演进: 从“面向人”到“面向 Agent”的运维范式转变,在长链路排查中的业务痛点,以及Agent带来哪些增量价值
- Eureka! 的设计初衷: Coding 的下一站是 Troubleshooting,旨在解决排查耗时长、协同成本高、经验难沉淀三大核心痛点
2. Eureka! RCA Agent 的架构设计与核心机制
- 多智能体范式驱动: 深度解析如何划分 SubAgent、构建高效的 Agent Team,并实现 LLM 在复杂场景下的自主规划与流程控制。
- 可解释性设计: 如何将 LLM 的“黑盒”思考过程转化为白盒化的推理路径,确保诊断过程可溯源、有结论
- 工程决定性约束: 如何通过工程手段约束 Agent 行为,通过典型 Case 阐述如何保证生产环境下 Agent 执行结果的相对稳定
3. 从 Hackathon Demo 走向落地的关键能力
- 从“动态推演”到“资产库”: 将复杂业务逻辑沉淀为AI Native的离线业务资产、将临时生成的排障逻辑固化到 Skill
- 动态工具调用与自进化: Agent 如何理解并精准调用各类可观测性工具 ,工具之间的迭代和进化
- Benchmark 体系构建: 排障领域的 Benchmark 设计思路,通过历史数据转储、仿真环境模拟等方式构建高质量数据集,持续评估 Agent
- 核心产品交互形态: 从 Chatbot 的以人驱动到 AI Native 的自驱动,结合在排障场景的经验思考,如何构建更高效的产品交互形态
4. 实践分享与未来范式展望
- 典型案例分享: 以业务核心指标下跌、Redis 可用性下跌场景为例,对比传统 SOP 与 Eureka! 自主排查的效率和准确性差异
- 核心沉淀: 提供有效线索、准确结论,确保证据真实、结果可解释是运维 Agent 走向生产的基石
- 未来演进: 迈向具备自主规划、持续学习能力的“Agent Native”平台工程新模型
您认为,这样的技术在实践过程中有哪些痛点?
- 推理路径的收敛性: 在极其复杂的环境下,如何防止 Agent 陷入无效的排查路径、准确识别问题路径和剪枝
- 工具与数据的质量: Agent 的准确性高度依赖于底层数据的完备性以及工具的描述,如何合理设计、持续迭代
演讲亮点
- 自主规划 vs 静态编排: 突破传统 SOP 限制,展示 AI 执行非预设路径的推理能力
- 白盒化推理过程: 通过关键实时线索传递,解决 SRE 对 AI 诊断结果的信任问题
- 自进化和知识资产: 介绍如何实现系统的自我迭代、如何持续构建业务数据资产
听众收益
- 设计思路: 深入理解基于 Plan + ReAct SubAgent架构的 RCA Agent 设计方案
- 工程经验: 相比可结构化的Coding代码、非结构化的排障经验如何沉淀为Agent能力
- 实践参考: 获取真实业务场景下如何构建可解释性与自动化的排障Agent实战参考