在系统规模不断扩大、架构日益复杂的背景下,传统依赖规则、告警和人工经验的运维方式... 展开 >





党受辉,腾讯 IEG 技术运营部助理总经理,专家工程师。腾讯游戏 SRE 负责人,负责研发工具链、运维自动化、线上可靠性等研运一体基础设施平台蓝鲸智云;信通院 SREelite《SRE 实践白皮书》作者之一。
在系统规模不断扩大、架构日益复杂的背景下,传统依赖规则、告警和人工经验的运维方式,已难以应对高频变更与不确定性风险。如何将 AI 能力真正嵌入站点可靠性工程(SRE)的核心工作流中?本专题将深入探讨 AI 如何与 SRE 的工程实践形成闭环。
在 AIGC 业务开始规模化落地后,我们的 SRE 团队很快感受到两股压力同时袭来:一方面是多层算法流带来的复杂调度与稳定性挑战,另一方面是长期积累的治理“旧账”——元数据散乱、标准化缺失,正在持续放大运维成本。与其继续靠堆人力硬扛,我们选择开启一条“补课式”的转型路径:一边补齐标准化与 SOP 的基础能力,一边探索基于 Multi-Agent 架构的智能运维体系。
在这次分享中,我会结合美图的真实实践,拆解我们如何利用 MCP 协议解耦复杂工具链,通过 Skills 机制将标准化运维能力封装为可执行单元,逐步打通从知识问答、OnCall 工单处理,到根因定位(RCA)与故障自愈的完整闭环。这套体系最终帮助我们实现了约 40% 的人效提升,也让运维从“人肉响应”走向“语义驱动执行”。
同时,我也会重点分享在生产环境中踩过的坑:例如如何划定 Agent 的指令安全边界,如何应对模型幻觉带来的数据一致性风险,以及这些取舍背后的工程权衡,希望为正在探索 SRE Agent 落地的团队提供一条可参考的演进路径。
演讲提纲
1. 序幕:AIGC 爆发下的运维“债务”危机
2. 筑基:Skills 体系——将 SOP 转化为 Agent 的“肌肉记忆”
3. 架构:基于 LangGraph 的有状态 Skills 调度
4. 实战:从“对话问答”到“闭环执行”的进阶
5. 深度反思:生产环境下的 Trade-off 与避坑
6. 总结:从“补课生”到“智理者”
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
本次分享将探讨 LLM 如何驱动运维领域从“自动化工具”迈向“智能体(Agent)”的深刻变革。我将解析从手动、脚本到平台,最终实现 AI 自主决策的三阶段模式演进。核心部分将以业务版本生命周期为主线,结合业务真实场景实战案例,详细拆解智能体(Agent)在 CI/ CD /CO 全链路(如代码分析、智能发布、业务巡检)的具体落地与应用。最终结合“AI 工时”策略,用精确数据验证智能化运维“数字分身”的降本增效成果,为团队转型提供实战参考。
演讲提纲
1. 运维模式的代际演变
2. “ AI 工时”与智能体类型
3. 场景落地:全生命周期的智能化实践
4. 收益与未来展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
在 AI 浪潮席卷运维领域的当下,我们常常陷入对“智能”的狂热追捧,却可能忽略了 SRE 的本质:一套将稳定性、效率、成本目标工程化、自动化的系统性实践。本次分享将结合小米在 AI for SRE 领域的探索,探讨一个核心命题:如何将 SRE 专家大脑中那些难以编码的隐性知识、经验与判断逻辑,有效地“注入” AI,并形成可度量、可进化的工程闭环?分享小米在核心 Skills 管理、记忆嵌入、数据资产沉淀方面的实践,解析背后的实现逻辑与架构。
演讲提纲
1. 回顾与演进——AI for SRE 的三级跳
2. 攻坚核心——SRE 知识资产的沉淀、激活与闭环
3. 实现架构
4. 展望与反思——AI 时代的 SRE“债务”与壁垒
对于小米而言,各业务线庞大、复杂、历史悠久的运维数据、流程知识与系统间隐式依赖,既是训练“最懂小米”的AI的独一无二燃料,其梳理、整合、合规使用的难度也构成了最大的壁垒。成功的关键在于,能否将这些“数据资产”工程化为“情境化知识资产”。
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
在小红书业务中随着 AI 成为搜索、推荐、广告等核心业务的主链路,系统稳定性面临的挑战已发生本质变化:模型异常不再只是效果波动,而是直接导致业务不可用;GPU、推理框架和模型本身,正在成为生产系统的一部分。在这样的背景下,SRE 的角色也必须进化。
本次分享我将介绍一种新的理念——AI-in-SRE Loop:AI 不只是用于告警和运维辅助,而是深度参与 SRE 的全生命周期决策,从事前预防、事中感知与定位,到事后学习与策略演进。希望为正在或即将进入 AI 规模化阶段的团队,提供一套可落地的工程路径。
演讲提纲
一、AI 系统稳定性:为什么“完全不一样”
1. AI 不稳定性的来源变化
2. 故障的“裂变方式”发生改变
3. 最真实的约束:资源与成本
二、AI-in-SRE Loop:一种新的稳定性范式
三、26 年 AI 应用的核心工程建设
1. AI 核心链路稳定性工程
2. 大模型可观测体系(SRE 的眼睛)
3. GPU 与异构算力稳定性治理
4. 智能拦截变更
四、SRE Agent:SRE 的“代理人”
五、总结:SRE 没有被 AI 替代,但 SRE 正在升级为AI 系统的可靠性工程师
您认为,这样的技术在实践过程中有哪些痛点?
1. 指标定义难
2. 自动化执行的信任问题
3. 成本与稳定性的天然冲突
4. 组织层面的阻力
演讲亮点
听众收益
1. 对 SRE / 架构师
2. 对 AI 平台 / 模型团队
3. 对技术管理者



微信咨询

电话咨询
领取往期热门演讲视频

