被评测应用已经从 NLP、排序列表和问答,快速扩展到会规划、调用工具并改变系统状态的多轮 Agent。评测因此不再只是上线前的验收动作,而成为业务目标、产品需求与 AI 能力持续双向校准的自进化 PRD。
本次分享介绍一套兼容多评测对象、多评测方法的中台实践:以 Plan-and-Execute 组织动态评测路径,通过 Code/LLM/Agent Judge 与人工校准协同完成验证,并将评测集、Rubric、真实会话、badcase 和分歧样本沉淀为可持续迭代的质量资产。分享将重点拆解复杂 Agent 的过程验真、评分器稳定性、数据与标准演进、多轮 badcase 复现,以及“评测的评测”如何为自进化建立护栏。
演讲提纲:
- 更精准、更低成本的评测诉求
- 业务与评测双咬合进化:评测是 AI 时代可自进化的 PRD
- 多种评测对象并存:NLP 结果、排序列表、LLM 问答、多轮 Agent 任务等,以及复杂 Agent 的评测挑战
- LLM-as-a-Judge 的价值、实践与局限是什么,需结合 Agent-as-a-Judge 提升复杂场景准确度
- 评测需求爆发,但评测本质是复杂工程科学
- 评测中台的价值与核心诉求
- 评测中台设计
- 中台设计目标:解决成本高、不稳定、不精准、复用性差等问题
- 中台分层结构:接入层、执行层、数据层、自进化层
- 执行范式:采用 Plan-and-Execute,由 Planner 生成计划、Executor 编排执行、Summary 完成三层归因、Annotation 标注并推动改进
- 动态执行方案:根据对象、数据、维度、风险和成本生成评测路径和调度策略
- 统一评分器:Judge Node 接入 Code Judge、LLM Judge 与 Agent Judge
- Agent Judge 稳定性:Harness 约束工具、轮次、Token、时间与结构化输出
- 评测触发机制:门禁准入、实时线上巡检、历史真实会话巡检
- 评测的评测:为评测自进化建立护栏
- 业务落地实践经验
- 评测集:按业务风险准备、更新与版本化数据集
- 评测维度:静态评测覆盖 Skill、Prompt、知识库,动态评测覆盖任务过程、工具调用、系统状态与最终结果
- Rubric 设计:单 query 定制 Rubric 与单目标通用 Rubric 的粒度取舍
- Rubric 稳定性:通过证据要求、正反例、缺证处理与一致性校准提升准确性
- 多轮执行:构造多轮评测,并复现和回放多轮 badcase
- 人工校准:聚焦低置信、人机分歧和高风险样本,沉淀 golden set 与分歧集
- 组织协同:明确不同角色的人与 AI Agent 的协同 SOP、站位与职责,何时需要做什么,使得系统Loop最更高效
- 总结与反思
- 评测成熟度如何度量、评测体系的进化路线
- 未来挑战:持续应对模型切换、工具变化、知识过期、记忆污染、环境漂移与成本上升带来的质量退化
- EDD 驱动的业务进化探索:PRD 与评测用例、预期结果同步给出
实践痛点:
- 覆盖率、准确率、成本之间的平衡三角需要反复调整,比如评测效率与评测覆盖;比如 rubric越明确和细化,打分稳定性和准确性越高,但是维护和迭代成本也更高
- 人机一致率、人人一致率、机机一致率 对齐成本高
- 多轮badcase问题复现难:长短期记忆难以构造、多人交互的时序问题处理
- agent 如果涉及前端样式评测,还需要还原客户端信息给人和评分器,否则与人的体验不一致
演讲前沿亮点:
- 支持多对象、多评测方法的统一建模、执行与归因
- 用 Plan-and-Execute 动态生成评测路径与数据,提升评测能力上限
- 用什么样的 Harness 提升 Agent Judge 的稳定性与可控性
- 用 golden set、分歧集和成熟度指标,实现“评测的评测”
听众收益:
- 理解如何搭建通用的评测中台框架
- 掌握评测过程的多轮 Agent 的过程验真、Rubric 设计和 badcase 复现思路
- 学会用评测数据、人工校准和归因结果,推动业务持续进化