专题演讲嘉宾:刘杨

蚂蚁集团架构师

当前任职蚂蚁可观测技术架构师,参与或负责了产品/告警/计算/元数据等在内的可观测全技术栈建设,对于大型大规模分布式计算系统有丰富的性能优化经验。最近两三年主要重心在大模型领域,包括推理引擎、Agent可观测等。

by 刘杨

蚂蚁集团
架构师

随着 Agent 进入真实业务场景,传统日志、指标和链路追踪已经难以完整回答 Agent 是否正确完成任务、问题发生在哪个环节,以及如何持续衡量和改善 Agent 质量。本次分享将介绍我们建设企业级 Agent 可观测与评估体系的实践。在采集层遵循 OpenTelemetry GenAI语义约定,统一模型调用、工具调用和 Agent 执行过程的埋点与采集。在评估层以 Trace 为核心,配置化接入诊断任务,通过实时处理管线完成任务筛选、关键信息提取和自动评估,到达分钟级延迟。通过声明式表达式支持不同业务 Agent 低成本接入。先小模型粗筛,再大模型精筛的两阶段评估机制,可有效降低90% token成本,使大规模安全、合规等底线类指标评估覆盖全生产流量成为可能。针对部分复杂性能与质量类问题,还将介绍从 Agent 执行链路深入至推理引擎内部推理过程的探索。

演讲提纲

  1. Agent 可观测面临的新问题
    • 为什么拥有日志、指标和完整 Trace,仍然难以判断 Agent 是否正确完成任务并定位质量问题。
  2. 遵循 GenAI 语义约定的统一埋点与采集
    • 如何统一模型调用、工具调用和 Agent 执行过程的遥测语义,并在标准字段基础上支持业务场景扩展。
  3. 以 Trace 为中心的实时评估链路
    • 从 Span 聚合、评估任务筛选和关键信息提取,到评估执行与结果沉淀。其中包括通过声明式表达式适配不同业务 Agent 和 Trace 结构,降低新 Agent 和新评估场景的接入成本。
  4. 面向全量生产流量的两阶段评估实践
    • 首先使用轻量小模型进行全量、低成本、高召回筛查;再对候选 Trace 按需加载完整执行上下文,由大模型完成精准语义裁决,在保障评估覆盖范围的同时控制实时运行成本。
  5. 从 Agent 执行到模型推理的深度分析
    • 如何关联 Agent Trace 与模型推理过程,在 Token 粒度进一步定位性能问题。并探索模型内部不确定性信号在轨迹分析中的应用。
  6. 真实业务落地案例与实践经验
    • 结合具体业务 Agent,介绍从标准化埋点、评估任务配置和生产运行,到问题发现、原因定位与质量改进的完整过程,并分享落地中的工程取舍与实践经验。

实践痛点

  1. 面向全量生产流量的两阶段评估实践可以有效解决token成本问题,但是强依赖有效的小模型。而小模型需要针对业务场景训练,才能做有效的过滤,成本不低。
  2. 从 Agent Trace 到推理引擎的跨层深度可观测,要求对推理引擎埋点,存在一定开发接入成本。

前沿亮点:

  1. 面向异构 Agent 的声明式 Trace 实时评估
    • 将 Trace 从事后查询的数据转变为持续运行的评估对象。评估任务可以通过配置动态定义 Trace 筛选、关键维度提取和评估输入。对于已经完成标准化埋点的 Agent,新增评估场景时无需修改 Agent 埋点或重复建设数据处理链路;接入新的 Agent 时,也可以通过表达式适配其业务 Trace 结构。
  2. 面向全量生产流量的两阶段评估
    • 针对安全、合规等底线类场景,首先使用轻量模型进行全量、低成本、高召回筛查;再对候选 Trace 按需加载完整执行上下文,由大模型完成精准语义裁决,在保障评估覆盖范围的同时控制实时运行成本。
  3. 从 Agent Trace 到推理引擎的跨层可观测
    • 将 Agent 业务请求、LLM 节点和模型推理过程关联起来,在 Token 粒度分析生成时序和推理性能,并结合 Token 概率分布、熵等不确定性信号,探索质量预测与后置分析。

听众收益

  • 了解如何基于统一的 GenAI 遥测语义构建 Agent 可观测基础,以及如何从标准化 Trace 进一步走向实时质量评估、大规模生产运行和深度问题定位,获得一套可用于 Agent 可观测体系化建设思路。
     

交通指南

上海建工浦江皇冠假日酒店

Shanghai Construction Group Pujiang Crowne Plaza Hotel
地址:上海市闵行区陈行公路 3701 号
  • 微信咨询

  • 电话咨询

    联系电话:18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手