马云雷,阿里云云原生可观测高级技术专家。负责 AgentLoop 的观测、评估、实验与调优能力建设,帮助开发者利用真实运行轨迹持续优化 Agent。 拥有 14 年可观测领域经验,先后参与日志采集、查询计算、向量检索和大模型可观测等多个方向的建设,从 0 到 1 参与阿里云可观测体系建设;擅长计算引擎、数据分析与算法。
马云雷,阿里云云原生可观测高级技术专家。负责 AgentLoop 的观测、评估、实验与调优能力建设,帮助开发者利用真实运行轨迹持续优化 Agent。 拥有 14 年可观测领域经验,先后参与日志采集、查询计算、向量检索和大模型可观测等多个方向的建设,从 0 到 1 参与阿里云可观测体系建设;擅长计算引擎、数据分析与算法。
Agent 上线之后,团队通常并不缺少 Trace,也不缺少一次性的评估工具,真正困难的是如何把这些能力串成一条可以持续运行的改进链路:原始 Trace 噪声多、结构不一致,无法直接作为评估对象;业务规则散落在人和文档中,难以转化为 Pipeline 和 Evaluator;Badcase 被发现后没有进入版本化数据集;Prompt、Skill 或 Harness 调整之后,也缺少一致的实验环境证明它真的变好了。
本次分享将介绍我们在Agent调优中的数据飞轮实践:首先将 Trace 按 Session 聚合并清洗为包含完整上下文和行为过程的 Trajectory;再通过可配置、可对话构建的 Pipeline 完成数据重组、语义增强、AI 预标注与分流,持续沉淀黄金数据集和回归集;随后组合 Code、LLM、Agentic 等不同 Evaluator,对文本、多模态输入、工具调用和任务完成过程进行持续评估,并将 Badcase 和评估证据回流数据集;最后通过 Baseline、实验、回归门禁验证 Prompt、Model、Tool、Skill、Workflow 与 Harness 的改动。
在此基础上,我们进一步将调优划分为手动挡、半自动挡和全自动挡:从人分析 Trace,到系统生成优化候选,再到自动实验和受控发布;并探索 Trace to Skill、Workflow、SQL、Script,以及 Trace-based Skill Optimize、Harness Fix 等面向不同对象的优化方法。
演讲提纲:
实践痛点:
前沿亮点:
听众收益:



微信咨询

电话咨询
微信联系我们

