本次分享将探讨 LLM 如何驱动运维领域从“自动化工具”迈向“智能体(Agent)”的深刻变革。我将解析从手动、脚本到平台,最终实现 AI 自主决策的三阶段模式演进。核心部分将以业务版本生命周期为主线,结合业务真实场景实战案例,详细拆解智能体(Agent)在 CI/ CD /CO 全链路(如代码分析、智能发布、业务巡检)的具体落地与应用。最终结合“AI 工时”策略,用精确数据验证智能化运维“数字分身”的降本增效成果,为团队转型提供实战参考。
演讲提纲
1. 运维模式的代际演变
2. “ AI 工时”与智能体类型
- 设计原则:基于 ReAct 模式(Reasoning + Acting),我们将模型的推理时长与工具执行时长融合,定义了新的度量标准——“AI工时”
- 智能体的三种形态:
- AI Chat (RAG):基于知识库的问答,辅助人工获取信息
- AI Task / Common:意图识别 + 参数提取。从“听懂指令”到“执行任务”,是当前的主流形态
- AI Auto (终极目标):具备主动发现、自主规划、智能编排的能力。它不再是被动响应,而是能进行动态规划和结果评估
- 概念引申:介绍“工时爆炸”与“工时提炼”的动态规划策略,解释AI如何处理复杂任务
3. 场景落地:全生命周期的智能化实践
- CI(集成阶段)—— 侧重连续性与安全
- CD(交付/部署阶段)—— 重头戏
- 测试环境(Autopilot 全 AI 托管)
- 正式环境(人机协同)
- 发布前:版本管理的 Checklist 检查、智能编排分组、发布前风险评估
- 发布中:业务巡检报告(运行镜像)、标准运维报错辅助分析(动态决策)
- 发布后:自动生成发布总结与复盘报告
- CO(运营阶段)—— 智能监控
- 指标监控与功能验证
- 利用 AI 进行舆情分析,辅助判断业务稳定性
4. 收益与未来展望
- 模式对比
- 原有模式(人 + 自动化业务):按人力投入( PMI )计算,成本高且弹性差
- 智能模式(AI + 审核):计算公式变革为 “测试服操作次数 × Agent 原子调用工时 + 正式服操作次数 × 单个 Agent 工时”
- 价值总结
- 不仅实现了降本(减少人力投入),更实现了增效( AI 24 小时待命,响应更稳更快)
- 未来展望
您认为,这样的技术在实践过程中有哪些痛点?
- SRE 是严肃且严谨的领域,如果把智能体安全的应用于 SRE 领域需要严格把控
- 如何衡量智能体的真实价值,要进行科学的评估,用数据说话
- 智能化过程中,大模型的泛化能力和上下文管理任然是一个难点,在进行智能体建设如果避免大模型短板或者借助其他手段解决问题非常关键
演讲亮点
- 智能体价值衡量
- SRE 智能体如何设计,如何结合平台能力
- 游戏版本周期内多智能体协作
听众收益
- 智能体在 SRE 领域如何落地,获得收益
- 智能体在游戏 SRE 的场景切入