随着 Agent 进入真实业务场景,传统日志、指标和链路追踪已经难以完整回答 Agent 是否正确完成任务、问题发生在哪个环节,以及如何持续衡量和改善 Agent 质量。本次分享将介绍我们建设企业级 Agent 可观测与评估体系的实践。在采集层遵循 OpenTelemetry GenAI语义约定,统一模型调用、工具调用和 Agent 执行过程的埋点与采集。在评估层以 Trace 为核心,配置化接入诊断任务,通过实时处理管线完成任务筛选、关键信息提取和自动评估,到达分钟级延迟。通过声明式表达式支持不同业务 Agent 低成本接入。先小模型粗筛,再大模型精筛的两阶段评估机制,可有效降低90% token成本,使大规模安全、合规等底线类指标评估覆盖全生产流量成为可能。针对部分复杂性能与质量类问题,还将介绍从 Agent 执行链路深入至推理引擎内部推理过程的探索。
演讲提纲
- Agent 可观测面临的新问题
- 为什么拥有日志、指标和完整 Trace,仍然难以判断 Agent 是否正确完成任务并定位质量问题。
- 遵循 GenAI 语义约定的统一埋点与采集
- 如何统一模型调用、工具调用和 Agent 执行过程的遥测语义,并在标准字段基础上支持业务场景扩展。
- 以 Trace 为中心的实时评估链路
- 从 Span 聚合、评估任务筛选和关键信息提取,到评估执行与结果沉淀。其中包括通过声明式表达式适配不同业务 Agent 和 Trace 结构,降低新 Agent 和新评估场景的接入成本。
- 面向全量生产流量的两阶段评估实践
- 首先使用轻量小模型进行全量、低成本、高召回筛查;再对候选 Trace 按需加载完整执行上下文,由大模型完成精准语义裁决,在保障评估覆盖范围的同时控制实时运行成本。
- 从 Agent 执行到模型推理的深度分析
- 如何关联 Agent Trace 与模型推理过程,在 Token 粒度进一步定位性能问题。并探索模型内部不确定性信号在轨迹分析中的应用。
- 真实业务落地案例与实践经验
- 结合具体业务 Agent,介绍从标准化埋点、评估任务配置和生产运行,到问题发现、原因定位与质量改进的完整过程,并分享落地中的工程取舍与实践经验。
实践痛点
- 面向全量生产流量的两阶段评估实践可以有效解决token成本问题,但是强依赖有效的小模型。而小模型需要针对业务场景训练,才能做有效的过滤,成本不低。
- 从 Agent Trace 到推理引擎的跨层深度可观测,要求对推理引擎埋点,存在一定开发接入成本。
前沿亮点:
- 面向异构 Agent 的声明式 Trace 实时评估
- 将 Trace 从事后查询的数据转变为持续运行的评估对象。评估任务可以通过配置动态定义 Trace 筛选、关键维度提取和评估输入。对于已经完成标准化埋点的 Agent,新增评估场景时无需修改 Agent 埋点或重复建设数据处理链路;接入新的 Agent 时,也可以通过表达式适配其业务 Trace 结构。
- 面向全量生产流量的两阶段评估
- 针对安全、合规等底线类场景,首先使用轻量模型进行全量、低成本、高召回筛查;再对候选 Trace 按需加载完整执行上下文,由大模型完成精准语义裁决,在保障评估覆盖范围的同时控制实时运行成本。
- 从 Agent Trace 到推理引擎的跨层可观测
- 将 Agent 业务请求、LLM 节点和模型推理过程关联起来,在 Token 粒度分析生成时序和推理性能,并结合 Token 概率分布、熵等不确定性信号,探索质量预测与后置分析。
听众收益
- 了解如何基于统一的 GenAI 遥测语义构建 Agent 可观测基础,以及如何从标准化 Trace 进一步走向实时质量评估、大规模生产运行和深度问题定位,获得一套可用于 Agent 可观测体系化建设思路。