当 Agent 从单点试用走向多团队、多场景和生产环境,挑战不再只是“能否完成一次任务”,而是如何统一托管 Agent 的配置、运行时、能力、权限、版本和执行反馈。如果缺少平台化管理,团队需要重复解决部署、通道接入、调试排查、版本发布、安全控制和故障恢复等外围问题,Agent 很难从个体实践演进为可复制的生产能力。
本次分享介绍百度运维部 AgentOps 的平台化建设实践:以 Runtime 全生命周期托管为基础,以安全管控守住执行边界,以场景仿真回放验证任务效果,以知识沉淀形成能力资产,并基于前述能力和用户反馈推动 Agent 自主进化。平台重点解决四类基础问题:如何让 Agent 快速接入并稳定运行,如何让每次变更可控可回滚,如何让执行过程可观测可验证,以及如何将分散经验沉淀为可复用资产。在此基础上,平台持续补充知识驱动的能力构建、规范审计、智能测试和运行时依赖切换等增量能力,推动 Agent 从“能用”走向“敢用、好用、可复制”。
演讲提纲
1. 从单点试用到规模化托管:企业 Agent 落地的新矛盾
- 接入与部署问题:不同团队重复准备环境、配置运行实例和接入消息通道,交付周期长
- 配置与版本问题:Agent、Skill、Prompt、工具和知识缺少统一版本边界,调试容易污染线上版本
- 运行与观测问题:实例状态、会话、工具调用和执行结果分散,出现 bad case 后难以定位
- 安全与权限问题:生产操作缺少统一的权限、审批、限流、审计和回滚控制
- 能力复用问题:公共工具、业务知识和历史经验难以沉淀,场景建设依赖少数专家
- 质量与演进问题:没有稳定的 Case、回放和评估体系,无法判断版本是否真的变好
- 平台定位:AgentOps 统一托管 Agent 的资产、运行时、执行路径和反馈闭环,让业务团队聚焦场景逻辑
2. AgentOps 总体架构:五项核心能力协同
- 接入层与平台 API 网关统一承载 Web、如流和第三方调用,提供鉴权、租户路由与配额控制
- 控制面由安全中心、变更中心、评估中心、知识管理和运行时管理组成,共享资产与观测数据
- 数据面区分正式 Agent 实例与调试沙盒,支持不同运行时以统一方式接入
- 五项核心能力协同:Runtime 全生命周期托管、安全管控、场景仿真回放、知识沉淀、自主进化
3. Runtime 全生命周期托管:让 Agent 稳定运行
- 统一管理 Agent 从创建、配置、部署、运行、升级、监控、故障恢复到下线的完整生命周期
- 统一管理配置、能力资产、运行实例、会话状态、版本发布与运行观测
- 通过健康检查、状态持久化、实例恢复和依赖切换保障 Agent 持续可用
4. 知识沉淀:让业务经验成为能力资产
- 统一管理 Agent、Skill、Prompt、工具、知识、Case 和运行时配置,明确资产之间的版本关系
- 通过知识库、公共能力和历史执行经验降低重复建设,形成可共享的能力供给
- 通过沙盒、Case、Trace 和回放建立从开发到上线的验证链路
- 知识沉淀的子主题包括:基于知识创建 Skill、Skill 规范审计、Skill 单测生成与知识检索引用
- 生成结果仍需经过规范审计、契约校验、场景回放和人工确认,不能直接进入生产
5. 安全管控:让 Agent 执行可控、可审计
- 安全链路:本地安全插件辅助拦截,中心式安全网关校验权限、参数和目标范围,统一审计
- 生产写操作:遵循审批、Dry-run、可回滚、可审计;安全监督 Agent 提供辅助判断,不替代强制控制
- 生产执行遵循风险分级、审批、Dry-run、可回滚和可审计
- 平台以统一网关、策略和 Hook 约束执行路径,不把安全责任交给 Prompt
6. 场景仿真回放:验证 Agent 是否真的有效
- 将线上 Trace 与人工反馈沉淀为 Case,在隔离沙盒中通过 API/HTTP Mock 重建外部依赖反馈
- 对比 Skill、模型和配置版本的任务表现,区分过程正确性、结果正确性与执行成本
- 把失败案例反馈到知识、Skill 和测试,生成候选改进,经审计、评估与发布审核后生效
- 自主进化指受控的能力迭代闭环,不是 Agent 自行修改生产配置或扩大权限
7. 自主进化:让用户反馈推动能力持续变好
- 自主进化建立在前四项核心能力之上,不是独立的模型自学习模块
- 线上执行结果、Trace、失败案例、用户修正和人工评价统一进入反馈链路
- 反馈形成知识、Skill、测试或配置的候选改进,经验证、审计、审批和版本发布后生效
- 形成“运行 → 反馈 → 沉淀 → 构建 → 回放 → 发布 → 再运行”的 Looping 闭环
8. 实践与工程权衡:贯穿一次 Agent 托管和演进
- 以一个真实线上异常场景为主线,贯穿知识准备、Agent 托管、故障处置、经验沉淀和后续复用,而不是分别展示平台功能按钮
- 展示 Agent 如何召回历史经验、组织现场证据、辅助收敛根因,并由工程师完成关键判断、动作授权和效果验收
- 展示一次故障结束后,如何将有效经验、失败尝试、业务知识、处置手册和工具改进回流资产
- 以 Trace、Case、复盘记录和用户反馈说明收益;明确哪些行为由 Agent 辅助,哪些决策仍由工程师负责
9. 总结与展望:从 Agent 托管走向经验共享与自主进化
- 整体目标:以知识沉淀和用户反馈为核心,提供一套标准、高可靠的百度 SRE Agent 建设方案
- Looping 闭环:通过“运行 → 反馈 → 沉淀 → 构建 → 回放 → 发布 → 再运行”,推动 Agent 能力持续改进和自主进化
- 最终愿景:让 Agent 实践从单点探索走向平台化建设、标准化复用和规模化落地
实践痛点
- 知识到可执行能力的转换难:文档常缺少前置条件、失败路径和权限边界,不能直接等同于可靠 Skill
- 生成与验证可能同源出错:同一模型生成 Skill 和测试时,可能把相同误解写进实现与断言
- 安全与处置效率存在权衡:生产操作必须受控,但审批、网关和审计链路不能成为新的故障放大点
- 高可用超出基础设施范畴:模型、密钥配置切换涉及授权、工具调用兼容、上下文连续性和重复执行风险
- 离线结果与线上表现存在差距:Mock 覆盖不完整、知识过期和模型变化都会影响回放结论的适用范围
演讲亮点
- 知识驱动的能力生产链路:打通知识沉淀、Skill 智能创建与单测智能生成,把专家经验变成可验证资产
- 分层质量保障:用规范审计、单测和场景回放分别解决合规、行为和任务效果问题,避免单一评分替代质量判断
- 面向模型依赖的 Agent 高可用:从实例与会话恢复扩展到模型、密钥配置快速切换,关注真实任务的连续性
- 可控的持续进化闭环:把生成、验证、发布、运行和反馈串联起来,能力更新可选择、可追溯、可回滚
听众收益
- 获得从业务知识到 Skill、单测和评估 Case 的建设方法,降低能力交付对个人经验的依赖
- 理解如何组合规范审计、单测和沙盒回放,构建分层质量门禁并避免“自证正确”
- 掌握 Agent 高可用的分层思路,以及模型与凭据切换中的兼容性、授权和重复执行边界
- 获得控制面与数据面分离的 AgentOps 架构参考,把安全托管和持续改进纳入统一工程体系