传统的运维平台正逐渐演变为以 Agent 为核心的交互式生态。当 Agent 能... 展开 >




运维领域多年从业者,Open-Falcon、Nightingale 等开源项目创始人和主程,极客时间专栏《运维监控系统实战笔记》作者,公众号 SRETALK 主理人,目前作为快猫星云的联合创始人,在可观测性领域创业中。
传统的运维平台正逐渐演变为以 Agent 为核心的交互式生态。当 Agent 能够自主调用 CLI、查询 Prometheus、甚至编写修复脚本时,运维的本质正从“编写逻辑”转向“编排智能”。Agent Ops 不仅是技术的升级,更是运维组织架构和流程的重构。
本专题旨在汇聚行业内顶尖的智能运维先行者,分享他们在构建“智能化运维中枢”时的实战经验。我们将深入讨论 Agent 如何与现有技术栈深度集成,并演进为具备长期记忆与自我进化能力的运维助手。
拟讨论的方向 / 拟解决的问题:
我们将共同定义下一代运维范式,让 Agent 真正成为 SRE 团队中永不疲倦的“资深战友”。
专题受众:SRE、DevOps 相关从业人员。
随着大模型与 Agent 的发展,运维平台正在演进为以 Agent 为核心的智能中枢。本次分享我将探讨可观测性数据如何从可视化、规则化迈向可被模型理解与推理的智能化阶段,并分析实现这一目标所需的数据规范与基础。在此基础上,深入讨论运维 Agent 在真实场景中的关键挑战,包括 Agent 如何与业务系统高效交互、如何理解复杂系统结构,以及如何通过知识图谱、知识库构建可持续进化的智能闭环,以及 Agent 落地过程中的工程实践与优化思路。
演讲提纲
1. 从 AIOps 到 Agent Ops
2. Agent Ops 实现的挑战与设计
3. Flashcat AI Agent 的落地实践
4. 可观测性智能化未来效果展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
面对企业级告警根因定位中的“诊断幻觉”与“证据断层”难题,本次分享提出一种基于逻辑证伪的推理树方案。该方案深度模拟专家排查思路,利用多路径假设并行考量多种潜在根因,构建出动态演进的逻辑推理树。在执行层面,系统驱动专用子智能体调用观测工具进行实据核验,并引入总结验证机制对推理逻辑进行自检,确保证据链的连贯自洽。我将结合实际案例,重点分享如何通过“动态假设与逻辑验证”闭环解决 Agent 定位冲突,实现复杂告警场景下的智能化排障落地。
演讲提纲
1. 告警诊断与大模型结合的困境
2. 根因定位智能体面临的工程挑战
3. RCA Agent 设计与实践
4. 总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
在面对庞大复杂的业务系统中,传统的自动化排障方案往往依赖于人工预定义的静态 SOP,对于未知/深层故障时力不从心。本次分享将介绍快手主站通用排障 AI Agent 实践 —— Eureka!。我们放弃了静态编排模式,转而采用 Plan/RePlan + ReAct 的 MultiAgent 范式组成 Agent Team,在部分场景下取得超越人类专家的推理效果。LLM 通过自主生成排查假设、动态调用自描述工具、结合数据资产沉淀进行深度推理,同时将验证有效的逻辑沉淀为可复用的智能资产。我将从业务视角出发,在核心业务指标下跌等极具复杂和挑战的真实案例下,深入探讨如何构建一个能召回、可解释、自进化的 RCA Agent 系统。
演讲提纲
1. 复杂业务场景下的排障困局与范式转变
2. Eureka! RCA Agent 的架构设计与核心机制
3. 从 Hackathon Demo 走向落地的关键能力
4. 实践分享与未来范式展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

