专题演讲嘉宾:石鹏(东方德胜)

美图高级运维经理,SRE 负责人

从业十余年,一直从事运维相关的工作。

2016 年加入美图公司,现任美图 SRE 负责人,目前整体负责美图公司线上服务的稳定性保障工作。曾多次参与或主导过美图公司多项基础设施、运维架构的调整和改造,在监控、灾备、故障管理、稳定性运营等方面有一定的经验积累和行业输出。

致力于推广 SRE、稳定性运营相关的理念及实践,编著有「SRE系统建设指南」图谱,参与过业界多个 SRE、DevOps 相关案例集/期刊/标准/白皮书的编纂或供稿。

业界多个技术峰会的分享嘉宾、金牌讲师或出品人, SRE 精英联盟成员。中国信通院「稳定性保障实验室」认证专家,应急工作组组长。

by 石鹏(东方德胜)

美图
高级运维经理,SRE 负责人

在 AIGC 业务开始规模化落地后,我们的 SRE 团队很快感受到两股压力同时袭来:一方面是多层算法流带来的复杂调度与稳定性挑战,另一方面是长期积累的治理“旧账”——元数据散乱、标准化缺失,正在持续放大运维成本。与其继续靠堆人力硬扛,我们选择开启一条“补课式”的转型路径:一边补齐标准化与 SOP 的基础能力,一边探索基于 Multi-Agent 架构的智能运维体系。

在这次分享中,我会结合美图的真实实践,拆解我们如何利用 MCP 协议解耦复杂工具链,通过 Skills 机制将标准化运维能力封装为可执行单元,逐步打通从知识问答、OnCall 工单处理,到根因定位(RCA)与故障自愈的完整闭环。这套体系最终帮助我们实现了约 40% 的人效提升,也让运维从“人肉响应”走向“语义驱动执行”。

同时,我也会重点分享在生产环境中踩过的坑:例如如何划定 Agent 的指令安全边界,如何应对模型幻觉带来的数据一致性风险,以及这些取舍背后的工程权衡,希望为正在探索 SRE Agent 落地的团队提供一条可参考的演进路径。

演讲提纲

1. 序幕:AIGC 爆发下的运维“债务”危机

  • 业务挑战:美图 AIGC 多层算法流带来的高频调度与稳定性压力
  • 现状审视:坦诚历史“旧账”——元数据散乱、标准化断层如何制约 Agent 的生产力
  • 演进策略:通过构建 “Skills-based SOP” 体系,实现运维能力的快速补齐与跨代演进

2. 筑基:Skills 体系——将 SOP 转化为 Agent 的“肌肉记忆”

  • 定义革新:从静态文档到可执行 Skills:包含专家经验、结构化约束与执行工具的统一封装
  • 方法论落地:如何通过 Agent 语义驱动,反向强制推行元数据治理与标准化运维建模
  • 补课成效:通过 Skills 的标准化沉淀,在解决历史债务的同时,为 Agent 提供精准的执行上下文

3. 架构:基于 LangGraph 的有状态 Skills 调度

  • 核心选型:为什么选择 LangGraph?解决故障处理中复杂的“循环判断”与“异常回滚”逻辑
  • 节点化编排:将每一个 Skill SOP 节点化,利用循环图实现复杂运维任务的动态自适应编排
  • 协议统一:引入 MCP (Model Context Protocol) 解耦工具层,构建标准化、可插拔的 SRE 能力库

4. 实战:从“对话问答”到“闭环执行”的进阶

  • 场景一:根因定位 (RCA):Agent 如何按照 SOP Skills 自动巡检、收集证据并实现分钟级的故障锁定
  • 场景二:全生命周期故障管理:打通告警压缩、工单处理到故障自愈的 Skills 流转闭环
  • 效能提升:实战数据展示:40% 效率提升背后的技术逻辑与人机协作模式

5. 深度反思:生产环境下的 Trade-off 与避坑

  • SOP 刚性 vs. 决策灵活性:如何在 LangGraph 中通过“条件边”设置安全红线,防止 Agent 跳出 SOP 范围
  • 一致性困境:解决秒级推理速度与毫秒级基础设施状态变化之间的“时序错位”
  • 幻觉治理:如何通过“语义沙箱”与“多重校验”规避模型虚构运维指令的风险

6. 总结:从“补课生”到“智理者”

  • 核心价值:Agent 不是取代 SRE,而是通过 Skills 体系释放人类的创造力
  • 未来展望:美图在自愈式基础设施治理上的下一步目标

您认为,这样的技术在实践过程中有哪些痛点?

  • 指令执行的安全边界 vs. 自动化效率: 在 SRE 场景下,完全闭环的自动操作(如自动重启或配置变更)风险极大。我们在实践中面临“人机协作”的权衡:是追求极致的自动化,还是保留强制的人工确认?最终我们通过“语义校验 + 灰度执行库”来建立安全水位,但这牺牲了一定的响应实时性。
  • 状态一致性挑战: SRE 环境是高度动态的,Agent 的推理速度(秒级)往往滞后于基础设施的状态变化(毫秒级)。如何确保模型在决策时看到的元数据不是“过期的快照”,是我们面临的长期挑战,涉及了复杂的实时缓存与感知反馈机制。
  • 模型幻觉与生产稳定性: LLM 可能在根因分析(RCA)中虚构不存在的指标或参数。我们选择了“限制搜索空间”的方案,即 Agent 只能在定义的 Skills 库内操作,这虽然增强了安全性,但也限制了 Agent 发现“黑天鹅”问题的天马行空。

演讲亮点

  • 基于 MCP 协议的“插件式”SRE 架构: 区别于业界常见的“硬编码”工具调用,我们引入了 MCP(Model Context Protocol) 协议来标准化 Skill 层。这使得运维工具链与模型底座实现完全解耦,不同团队开发的运维脚本只需简单适配即可转化为 Agent 的原子能力
  • 补课式”元数据治理路径: 我们分享的重点不在于模型多强,而在于如何通过 Agent 倒逼运维标准化。我们展示了一套“元数据-标准化-Agent驱动”的演进模型,通过 LLM 语义识别来反向清理历史冗余的资产数据,这种“由上而下”的治理思路与传统“由底向上”的方式截然不同

听众收益

  • 获得一份“旧账”公司的智能运维转型地图: 针对历史债务沉重(资产乱、流程杂)的企业,听众可以学习如何通过“补课”策略,在不重构全量底层系统的前提下,快速上线具备生产力的 SRE Agent
  • 掌握 Multi-Agent 在垂直领域的落地架构: 深入了解如何利用 Python/Celery 构建高并发的 Agent 任务调度层,以及如何设计多 Agent 协作流(如从工单助手到故障自愈的交接棒逻辑)
  • 避坑指南: 听众将直接获得我们在生产环境中使用 Agent 进行故障定位与风险评估时的真实失效案例,了解如何从流程、工程和算法三个维度规避 Agent 的“乱作为”

交通指南

北京富力万丽酒店

Renaissance Beijing Capital Hotel
地址:北京市朝阳区东三环中路61号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手