Agent Ops:运维新生产力

会议室:首府5
出品人:秦晓辉

传统的运维平台正逐渐演变为以 Agent 为核心的交互式生态。当 Agent 能... 展开 >

专题出品人:秦晓辉

快猫星云联合创始人

运维领域多年从业者,Open-Falcon、Nightingale 等开源项目创始人和主程,极客时间专栏《运维监控系统实战笔记》作者,公众号 SRETALK 主理人,目前作为快猫星云的联合创始人,在可观测性领域创业中。

地点:首府5

专题:Agent Ops:运维新生产力

传统的运维平台正逐渐演变为以 Agent 为核心的交互式生态。当 Agent 能够自主调用 CLI、查询 Prometheus、甚至编写修复脚本时,运维的本质正从“编写逻辑”转向“编排智能”。Agent Ops 不仅是技术的升级,更是运维组织架构和流程的重构。

本专题旨在汇聚行业内顶尖的智能运维先行者,分享他们在构建“智能化运维中枢”时的实战经验。我们将深入讨论 Agent 如何与现有技术栈深度集成,并演进为具备长期记忆与自我进化能力的运维助手。

拟讨论的方向 / 拟解决的问题:

  • 运维知识库构建:如何将 Linux、K8s、Network、自研的业务应用 等各类排障经验转化为 Agent 的有效记忆。
  • 反馈回路:利用人类专家反馈持续优化运维 Agent 的决策精准度。
  • 工具应用实践:Agent 如何精准调用工具 API(如 Prometheus、CMDB)让各类系统良好协同。
  • 未来范式:从“人机协同”迈向“Agent Native”的平台工程新模型。

我们将共同定义下一代运维范式,让 Agent 真正成为 SRE 团队中永不疲倦的“资深战友”。

专题受众:SRE、DevOps 相关从业人员。

by 裴彤

快猫星云
AI 产品研发负责人

随着大模型与 Agent 的发展,运维平台正在演进为以 Agent 为核心的智能中枢。本次分享我将探讨可观测性数据如何从可视化、规则化迈向可被模型理解与推理的智能化阶段,并分析实现这一目标所需的数据规范与基础。在此基础上,深入讨论运维 Agent 在真实场景中的关键挑战,包括 Agent 如何与业务系统高效交互、如何理解复杂系统结构,以及如何通过知识图谱、知识库构建可持续进化的智能闭环,以及 Agent 落地过程中的工程实践与优化思路。

演讲提纲

1. 从 AIOps 到 Agent Ops

  • 可观测性智能化的演进 Level,数据达到 AI-Ready 的条件
  • AIOps 侧重对可观测性系统使用的智能化,而 Agent Ops 还需要进一步提升配置端的智能化,实现 AI for Data 和 Data for AI 的闭环,从可观测性数据的生产、使用,实现全链路智能

2. Agent Ops 实现的挑战与设计

  • Agent 如何与业务系统进行交互:面向 Agent 的数据抽象与查询机制设计,包括指标、日志、trace、事件、工作流等各类信息的接入和使用
  • Agent 如何理解业务系统:通过构建 AI-Native 的运维知识图谱,以及业务知识库和反馈回路的搭建,建设 AI 可理解、可使用的 Agent 系统
  • AI For Data 的数据建设:通过 Agent 持续挖掘、完善数据关联关系,构建从数据理解到知识增强的全链路闭环
  • Agent 落地的工程挑战与优化:包括 Tool / Skill 的设计原则、ReAct 模式的应用以及 Multi-Agent 架构中上下文工程的优化实践

3. Flashcat AI Agent 的落地实践

4. 可观测性智能化未来效果展望

  • 持续进化、自主学习的 Agent 基座
  • 自主规划、人机协同的新范式

您认为,这样的技术在实践过程中有哪些痛点?

  • Agent 准确性强依赖于数据完善程度,建设全面准确的底层数据,是实际落地中比较大的挑战

演讲亮点

  • AI-Native 的运维知识图谱构建,让 Agent 更好的理解业务系统,能够真正做到 Agent Ops 落地
  • 基于 AI 不断完善数据准确性,形成闭环的数据建设体系,持续提升 Agent 的准确性

听众收益

  • 可观测性 AI 的数据建设方法
  • Ops Agent 的设计思路和工程实践经验

by 刘至浩

趣丸科技
高级平台研发工程师

面对企业级告警根因定位中的“诊断幻觉”与“证据断层”难题,本次分享提出一种基于逻辑证伪的推理树方案。该方案深度模拟专家排查思路,利用多路径假设并行考量多种潜在根因,构建出动态演进的逻辑推理树。在执行层面,系统驱动专用子智能体调用观测工具进行实据核验,并引入总结验证机制对推理逻辑进行自检,确保证据链的连贯自洽。我将结合实际案例,重点分享如何通过“动态假设与逻辑验证”闭环解决 Agent 定位冲突,实现复杂告警场景下的智能化排障落地。

演讲提纲

1. 告警诊断与大模型结合的困境

  • 幻觉干扰:模型处理运维专业语义时,易产生与事实相悖的结论
  • 经验数字化难题:专家非标经验难以通过传统 Prompt 工程有效捕捉
  • 工具调用瓶颈:通用 Agent 调用海量运维 API 时,准确率难以满足生产要求

2. 根因定位智能体面临的工程挑战

  • 长链路下的实时定位困境:如何在海量干扰信息中精准锁定核心故障节点
  • 结论幻觉与证据断层:如何通过工程手段解决“有结论、无证据”的失真问题
  • 诊断过程黑盒化:如何提升诊断路径的可追溯性,增强 SRE 的实战信任感

3. RCA Agent 设计与实践

  • 多路径假设生成:并行权衡多种诱因,规避单路径推理偏见
  • 动态演进推理树:将排查过程结构化,实现诊断逻辑的可视化与追踪
  • 子智能体协同验证:采取执行层解耦策略,驱动子智能体执行实据核证
  • 总结验证闭环:通过逻辑审计建立从“假设”到“事实”的严密反馈

4. 总结与展望

  • 核心沉淀:逻辑严密性与证据真实性是运维 Agent 走向生产的基石
  • 未来演进:从被动辅助诊断向具备自主规划能力的运维智能体迈进

您认为,这样的技术在实践过程中有哪些痛点?

  • 生成有效的假设挑战大:依赖数据、知识库与记忆能力的底层支撑
  • 依赖工具准确性:子智能体调用工具及生成查询参数的精准度

演讲亮点

  • 动态推理假设验证
  • Multi-Agent 架构的上下文隔离
  • 构建透明的推理证据链

听众收益

  • 深入理解基于“假设-验证”闭环的推理思维链
  • 如何通过工程化降低故障根因定位准确性
  • 如何提升 Agent 根因定位领域中可解释性

by 郭勇良

快手
资深服务端架构师

在面对庞大复杂的业务系统中,传统的自动化排障方案往往依赖于人工预定义的静态 SOP,对于未知/深层故障时力不从心。本次分享将介绍快手主站通用排障 AI Agent 实践 —— Eureka!。我们放弃了静态编排模式,转而采用 Plan/RePlan + ReAct 的 MultiAgent 范式组成 Agent Team,在部分场景下取得超越人类专家的推理效果。LLM 通过自主生成排查假设、动态调用自描述工具、结合数据资产沉淀进行深度推理,同时将验证有效的逻辑沉淀为可复用的智能资产。我将从业务视角出发,在核心业务指标下跌等极具复杂和挑战的真实案例下,深入探讨如何构建一个能召回、可解释、自进化的 RCA Agent 系统。

演讲提纲

1. 复杂业务场景下的排障困局与范式转变

  • 从静态 SOP 到动态推理: 传统的规则引擎或 Worlflow 应对复杂业务的复合故障、未知/深层故障时的局限性与挑战
  • 面向Agent的核心演进: 从“面向人”到“面向 Agent”的运维范式转变,在长链路排查中的业务痛点,以及Agent带来哪些增量价值
  • Eureka! 的设计初衷: Coding 的下一站是 Troubleshooting,旨在解决排查耗时长、协同成本高、经验难沉淀三大核心痛点

2. Eureka! RCA Agent 的架构设计与核心机制

  • 多智能体范式驱动: 深度解析如何划分 SubAgent、构建高效的 Agent Team,并实现 LLM 在复杂场景下的自主规划与流程控制。
  • 可解释性设计: 如何将 LLM 的“黑盒”思考过程转化为白盒化的推理路径,确保诊断过程可溯源、有结论
  • 工程决定性约束: 如何通过工程手段约束 Agent 行为,通过典型 Case 阐述如何保证生产环境下 Agent 执行结果的相对稳定

3. 从 Hackathon Demo 走向落地的关键能力

  • 从“动态推演”到“资产库”: 将复杂业务逻辑沉淀为AI Native的离线业务资产、将临时生成的排障逻辑固化到 Skill
  • 动态工具调用与自进化: Agent 如何理解并精准调用各类可观测性工具 ,工具之间的迭代和进化
  • Benchmark 体系构建: 排障领域的 Benchmark 设计思路,通过历史数据转储、仿真环境模拟等方式构建高质量数据集,持续评估 Agent
  • 核心产品交互形态: 从 Chatbot 的以人驱动到 AI Native 的自驱动,结合在排障场景的经验思考,如何构建更高效的产品交互形态

4. 实践分享与未来范式展望

  • 典型案例分享: 以业务核心指标下跌、Redis 可用性下跌场景为例,对比传统 SOP 与 Eureka! 自主排查的效率和准确性差异
  • 核心沉淀: 提供有效线索、准确结论,确保证据真实、结果可解释是运维 Agent 走向生产的基石
  • 未来演进: 迈向具备自主规划、持续学习能力的“Agent Native”平台工程新模型

您认为,这样的技术在实践过程中有哪些痛点?

  • 推理路径的收敛性: 在极其复杂的环境下,如何防止 Agent 陷入无效的排查路径、准确识别问题路径和剪枝
  • 工具与数据的质量: Agent 的准确性高度依赖于底层数据的完备性以及工具的描述,如何合理设计、持续迭代

演讲亮点

  • 自主规划 vs 静态编排: 突破传统 SOP 限制,展示 AI 执行非预设路径的推理能力
  • 白盒化推理过程: 通过关键实时线索传递,解决 SRE 对 AI 诊断结果的信任问题
  • 自进化和知识资产: 介绍如何实现系统的自我迭代、如何持续构建业务数据资产

听众收益

  • 设计思路: 深入理解基于 Plan + ReAct SubAgent架构的 RCA Agent 设计方案
  • 工程经验: 相比可结构化的Coding代码、非结构化的排障经验如何沉淀为Agent能力
  • 实践参考: 获取真实业务场景下如何构建可解释性与自动化的排障Agent实战参考

交通指南

北京富力万丽酒店

Renaissance Beijing Capital Hotel
地址:北京市朝阳区东三环中路61号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手