面向差异化标准的 Agent 评估:小红书可扩展编排实践

所属专题:AI Agent 可观测与持续改进工程

嘉宾 : 林能源 | 小红书技术专家

讲师介绍

专题演讲嘉宾:林能源

小红书技术专家

林能源,小红书技术专家,长期从事可观测平台与稳定性工程建设,近年来聚焦 AI 应用观测、Agent 开发与评估,负责相关平台的架构设计与工程落地。在全链路追踪、高可用治理及混沌工程等领域积累了丰富实践,并参与大模型训练与推理的观测诊断能力建设。曾负责美团 CAT 的业务指标监控、告警能力,关注如何通过运行数据与可扩展评估,持续提升 Agent 的业务效果与运行质量。

议题介绍

演讲:面向差异化标准的 Agent 评估:小红书可扩展编排实践

面对不同人群对 Agent 评估标准的差异化需求,本次分享介绍小红书普通配置与高级编排的方案取舍,展开多粒度评估、评估器组合、数据处理与串并行编排等关键技术,以及在线、离线评估的双轨闭环。结合真实案例,分享通用评估适配不足、复杂编排配置成本高及业务深度协作等落地经验。

演讲提纲:

  1. Agent 评估的差异化需求与分层架构
    • 产品运营、轻量与深度 Agent 开发者的评价标准与使用需求;普通模式与高级模式的产品设计和适用边界;通用能力、业务定制与配置复杂度之间的取舍;统一评估底座的架构设计。
  2. 多粒度评估与可扩展编排框架
    • 从生产 Trace、用户反馈和业务用例构建评估集;覆盖结果、节点、轨迹与多轮任务的评估需求;规则、代码、LLM Judge 与人工校准的分工;通过数据清洗、字段映射、共享中间结果及串并行编排,适配差异化业务标准。
  3. 在线与离线评估的双轨闭环
    • 离线侧通过固定数据集、任务回放与版本对比验证修改效果;在线侧通过生产流量采样、持续评估和问题复核发现真实问题;讨论问题回流、数据集版本管理与持续回归的衔接设计,结合业务效果、时延及成本分析改进收益。

实践痛点:

  1. 通用评估的业务适配能力有限。
    • 普通模式配置简单,适合快速验证,但面对差异化标准和复杂任务,通用指标难以准确反映真实业务效果。
  2. 高级编排的配置与协作成本较高。
    • 高级模式能够满足核心 Agent 业务的定制需求,但配置与调试复杂,需要业务深度参与标准定义、样本建设和评估校准。

前沿亮点:

  • 差异化标准驱动的分层设计:结合不同人群的评估需求,解析普通配置与高级编排的适用边界和设计取舍。
  • 多粒度评估与可扩展编排:介绍结果、节点、轨迹及多轮评估,以及多类评估器、共享中间结果和串并行流程的组合设计。
  • 双轨协同与真实案例复盘:围绕离线验证、在线评估和问题回流,分享通用能力适配、复杂配置与业务协作中的实践经验。

听众收益:

  • 了解如何根据业务标准和评估深度,选择合适的产品模式与技术方案。
  • 掌握将业务要求转化为评估维度、评估器和可执行流程的关键设计思路。
  • 获得版本验证、问题回流及业务共建的方法参考,减少评估平台落地中的配置与协作成本

交通指南

上海建工浦江皇冠假日酒店

Shanghai Construction Group Pujiang Crowne Plaza Hotel
地址:上海市闵行区陈行公路 3701 号
  • 微信咨询

  • 电话咨询

    联系电话:18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手