专题演讲嘉宾:章平

亚马逊云科技Agent 架构师

2014 年起就职于亚马逊云科技,先后加入技术支持和解决方案团队,致力于客户业务在云上高效落地。对于各类云计算产品和技术,特别是在生成式 AI、Agent、数据库和大数据方面,拥有丰富的技术实践和行业解决方案经验。此前曾就职于 Sun,Oracle,Intel 等 IT 企业。

by 章平

亚马逊云科技
Agent 架构师

Agent 在生产环境中的应用,因其非确定性推理与动态工具交互的特性,普遍面临质量难以量化、问题发现滞后、优化方向不明确的挑战。一个案例是:某旅游搜索 Agent 用户参与度下降 15%,传统监控显示所有技术指标正常,但用户体验持续降级长达 7 周才被发现和修复。根本原因在于缺乏系统化的评估体系。


为解决此问题,我们构建了一套从离线评测到在线监控的 Agent 评估工程体系。通过 Ground Truth + LLM-as-Judge 的混合评估范式,覆盖从单次响应到完整会话的多层次评估;建立能力评估 → 回归评估 → 生产监控 三阶段演进路径,将评估融入从开发到生产的全生命周期;结合可观测性数据实现自动化采样评估,从" 4 周发现问题 + 3 周修复"缩短到" 2小时发现 + 1 天修复"。同时,通过评估任务设计的最佳实践、非确定性处理方法(pass@k/pass^k)、以及评估器校准机制,为 Agent 的可靠、高质量运行提供坚实保障。

演讲提纲

1. 开场:从"盲目调优"到"数据驱动"

  • 真实案例:旅游搜索 Agent 的 7 周隐形降级
    • 用户参与度下降 15%,无效反馈增加 23%
    • 传统监控盲区:响应时间、错误率全部正常
    • 根本原因:缺乏系统化的评估体系

2. Agent 评估的本质挑战

  • 为什么传统测试方法不够用?
    • 非确定性:同一输入产生不同输出
    • 主观性:有用性、语气等难以量化
    • 多维度:需同时评估正确性、效率、成本
  • 旅游搜索 Agent 的评估缺失
    • 工具调用成功率 98%(技术指标正常)
    • 工具选择准确性从 92% 降至 67%(质量指标异常)
    • 如果有评估体系:提示词修改前就能发现问题

3. Agent 评估工程的方法论

  • 评估的两种范式:Ground Truth vs LLM-as-Judge
  • 评估的三个层次:Output, Trace , Session
  • 评估体系的构建流程(核心方法论): 能力评估/回归评估/生产监控
  • 评估任务设计的最佳实践:任务来源真实,任务质量要严格,评估器要校准。完整案例:客服退款场景的评估设计
  • 处理非确定性:pass@k 与 pass^k
  • 结合可观测性的自动化评估

4. 工程实践与落地路径

  • 从零到一:构建评估体系
  • 工具选型建议:评估框架/可观测性平台/选型原则
  • 真实案例:三个不同场景 Agent 的评估设计:编码,、客服、研究
  • 避坑指南

5. 总结与展望

您认为,这样的技术在实践过程中有哪些痛点?

  • 评估任务设计的质量控制难
  • LLM-as-Judge 的可靠性与成本平衡
  • 非确定性带来的评估复杂度
  • 评估与开发流程的集成难度
  • 生产环境评估的采样策略与性能开销

演讲亮点

  • 从"问题驱动"到"方法论沉淀"的完整路径
    • 以真实生产事故(7周降级)开场,引出评估体系的必要性
    • 系统化讲解评估方法论:两种范式、三个层次、三阶段演进
    • 提供可落地的 8 周实施路线图,而不是泛泛而谈的概念
  • Ground Truth + LLM-as-Judge 的混合评估范式
    • 不是简单的"用 LLM 评估一切",而是根据场景选择合适的评估方式
    • 提供完整的客服退款场景 YAML 案例,展示如何设计多层次评估
    • 讲解评估器校准机制,确保 LLM-as-Judge 的可靠性
  • 自动化评估 + 可观测性数据的工程化闭环
    • 不停留在"手动运行评估",而是通过可观测性数据实现自动化采样评估
    • 完整代码示例:从采样 → 评估 → 告警 → 诊断的全流程
    • 效果量化:7周 → 2小时发现 + 1天修复,展示实际价值
  • 处理非确定性的 pass@k 和 pass^k 方法
    • 深入讲解 Agent 非确定性带来的评估挑战
    • 提供 pass@k(至少一次成功)和 pass^k(全部成功)两种指标
    • 明确不同产品场景的指标选择:开发阶段 vs 生产部署
  • 三个不同场景的评估设计案例
    • 编码 Agent、客服 Agent、研究 Agent 的评估设计对比
    • 展示评估方法论在不同领域的适用性
    • 提供可复用的评估设计模板

听众收益

  • 一套可落地的 Agent 评估体系构建方法论
  • 可直接复用的工程实践清单与踩坑经验
  • 自动化评估 + 可观测性数据的集成思路
  • 处理 Agent 非确定性的量化方法
  • 真实生产案例的诊断与优化经验

交通指南

北京富力万丽酒店

Renaissance Beijing Capital Hotel
地址:北京市朝阳区东三环中路61号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手