Agent 大规模落地之后,团队遇到的核心挑战变成了如何让 Agent 在生产中... 展开 >


阿里云 SLS & AgentLoop 技术负责人,资深技术专家。十余年分布式系统与底层基础设施经验,主导了阿里云日志服务(SLS)从日志采集到统一可观测平台的演进。近年带领团队从传统可观测领域切入 AI Agent 的观测、评估与优化方向,打造 AgentLoop —— 面向 Agent 全生命周期的可观测与持续改进平台。
Agent 大规模落地之后,团队遇到的核心挑战变成了如何让 Agent 在生产中持续变好,不断提升效果、优化效率、降低成本、安全可控,这对 Agent 的可观测和持续改进提出了更多、更高的要求。
过去一年,行业出现了几个明显的拐点:
与此同时,可观测、评估和安全治理正在围绕统一的 trace 数据模型快速融合,OpenTelemetry GenAI Conventions 等标准开始获得广泛采纳。
当 Agent 从原型走向生产,看见它在做什么、判断它做得好不好、让它自动变得更好、更加安全可靠, 正在成为比选模型更重要的工程能力——本专题聚焦 AI Agent 的可观测、评估与持续改进实践。
话题方向涵盖:
听众收益
当全行业都在为“如何让 LLM 评价得更准”而绞尽脑汁时,我们是否走错了路?传统的生成式 LLM-as-a-Judge 正在成为企业沉重的“算力枷锁”:不仅全量评测成本高昂,更深陷字数偏置、中心化趋向等系统性偏置。
本次分享将带来一种全新的“探测式评测”范式——BoRP(Bootstrapped Regression Probing)。我们不再让模型“写”评语,而是直接“读取”模型隐状态下的满意度信号。通过对比表示提取与 PLS 回归技术,我们将评测成本降低了 97%,同时在人类对齐度上超越了传统的生成式 Judge。我们将深入解析如何从零构建这套“读脑”管线,包括如何在无标注流量中自动孵化评测标准,以及如何通过层间不确定性量化评测的可信度。这一方案已在万亿级流量的 A/B 测试中落地,为模型迭代提供了实时、高敏的“体温计”。
演讲提纲
实践痛点:
前沿亮点:
听众收益:
随着 Agent 进入真实业务场景,传统日志、指标和链路追踪已经难以完整回答 Agent 是否正确完成任务、问题发生在哪个环节,以及如何持续衡量和改善 Agent 质量。本次分享将介绍我们建设企业级 Agent 可观测与评估体系的实践。在采集层遵循 OpenTelemetry GenAI语义约定,统一模型调用、工具调用和 Agent 执行过程的埋点与采集。在评估层以 Trace 为核心,配置化接入诊断任务,通过实时处理管线完成任务筛选、关键信息提取和自动评估,到达分钟级延迟。通过声明式表达式支持不同业务 Agent 低成本接入。先小模型粗筛,再大模型精筛的两阶段评估机制,可有效降低90% token成本,使大规模安全、合规等底线类指标评估覆盖全生产流量成为可能。针对部分复杂性能与质量类问题,还将介绍从 Agent 执行链路深入至推理引擎内部推理过程的探索。
演讲提纲
实践痛点
前沿亮点:
听众收益
运维的数据早就齐了——指标、日志、Trace、变更、CMDB 都在线上,但一个告警落地后,人仍要跨多个平台拼上下文、做初判、推处置。瓶颈不在工具覆盖度,在事件处理链路没被系统串起来。
我们没有把工具都挂到一个问答框里,而是把运维事件做成一等公民:告警、巡检、变更、应急触发后,先由确定性 pipeline 完成上下文预取,再交给 Agent 做归因推理与方案生成,并且在上下文中持续更新运维事件的状态。
但跑通一次只是起点。运维场景的长期难题是经验只沉淀在个别人身上、同类误判反复出现。所以我们把改进助手本身也做成闭环:从事件处理过程中提取运维经验,在同类事件中召回复用,用线上反馈驱动迭代,并配套可回归、可回滚的验证机制。体系已在公司多条核心业务线的大盘巡检、告警初判、应急定位场景落地。本次分享会讲清这套运维事件驱动的Agent架构,以及如何让运维Agent能持续进化。
演讲提纲:
实践痛点:
演讲前沿亮点:
听众收益:
大多数团队的 Agent 停在「能跑一次」:demo 惊艳,上生产后开始悄悄跑偏——输出看着完整却没达标、反复调同一个工具烧 token 却零推进、结果对但过程越权。根因不是模型不够强,而是缺少独立评估闭环。本次分享拆解两条仍在生产运行的 Loop:一条每天自动产出会议纪要并自我进化,一条支撑开放平台「申请→自动开通→通知→日报」。核心是双层评估:生产 checker 打 94 分,每天另跑一个盲评 Meta-Evaluator 只给 85 分,偏差超过 8 分自动触发 rubric 校准;每周再用 Planner-Generator-Evaluator 三 Agent 做单变量对抗迭代,让系统自己升级并支持快照回滚。我会给出可复用的设计八问、三类隐性失控信号的监控方式,以及一串真实踩坑:prompt 层去重被 LLM 无视、写接口「假成功」、快照把磁盘和 inode 双撑爆、评估成本翻倍怎么权衡。目标是让你的 Loop 从「跑通一次」变成「连续跑对十次」。
演讲大纲:
您认为,这样的技术在实践过程中有哪些痛点?
演讲有哪些前沿亮点?
面对不同人群对 Agent 评估标准的差异化需求,本次分享介绍小红书普通配置与高级编排的方案取舍,展开多粒度评估、评估器组合、数据处理与串并行编排等关键技术,以及在线、离线评估的双轨闭环。结合真实案例,分享通用评估适配不足、复杂编排配置成本高及业务深度协作等落地经验。
演讲提纲:
实践痛点:
前沿亮点:
听众收益:
Agent 上线之后,团队通常并不缺少 Trace,也不缺少一次性的评估工具,真正困难的是如何把这些能力串成一条可以持续运行的改进链路:原始 Trace 噪声多、结构不一致,无法直接作为评估对象;业务规则散落在人和文档中,难以转化为 Pipeline 和 Evaluator;Badcase 被发现后没有进入版本化数据集;Prompt、Skill 或 Harness 调整之后,也缺少一致的实验环境证明它真的变好了。
本次分享将介绍我们在Agent调优中的数据飞轮实践:首先将 Trace 按 Session 聚合并清洗为包含完整上下文和行为过程的 Trajectory;再通过可配置、可对话构建的 Pipeline 完成数据重组、语义增强、AI 预标注与分流,持续沉淀黄金数据集和回归集;随后组合 Code、LLM、Agentic 等不同 Evaluator,对文本、多模态输入、工具调用和任务完成过程进行持续评估,并将 Badcase 和评估证据回流数据集;最后通过 Baseline、实验、回归门禁验证 Prompt、Model、Tool、Skill、Workflow 与 Harness 的改动。
在此基础上,我们进一步将调优划分为手动挡、半自动挡和全自动挡:从人分析 Trace,到系统生成优化候选,再到自动实验和受控发布;并探索 Trace to Skill、Workflow、SQL、Script,以及 Trace-based Skill Optimize、Harness Fix 等面向不同对象的优化方法。
演讲提纲:
实践痛点:
前沿亮点:
听众收益:
被评测应用已经从 NLP、排序列表和问答,快速扩展到会规划、调用工具并改变系统状态的多轮 Agent。评测因此不再只是上线前的验收动作,而成为业务目标、产品需求与 AI 能力持续双向校准的自进化 PRD。
本次分享介绍一套兼容多评测对象、多评测方法的中台实践:以 Plan-and-Execute 组织动态评测路径,通过 Code/LLM/Agent Judge 与人工校准协同完成验证,并将评测集、Rubric、真实会话、badcase 和分歧样本沉淀为可持续迭代的质量资产。分享将重点拆解复杂 Agent 的过程验真、评分器稳定性、数据与标准演进、多轮 badcase 复现,以及“评测的评测”如何为自进化建立护栏。
演讲提纲:
实践痛点:
演讲前沿亮点:
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

