电商导购并非简单的问答或商品检索,而是一个横跨导购决策、搜索推荐、营销优惠、商品信息、交易履约与售后服务等多个业务域的复杂 Agent 场景。我们基于Agent Loop范式构建生产级导购助手,通过统一 Tool 协议、动态上下文管理、任务规划与多域工具编排,让模型能够理解用户隐含需求,并在复杂链路中完成信息查询、商品筛选、优惠计算与服务决策。实践中重点解决了工具数量膨胀、跨域信息冲突、链路超时、错误传播及模型与 Harness 问题难以区分等挑战,并通过轨迹观测、评测回归和策略治理持续优化效果。实践表明,复杂业务 Agent 落地的关键,不只是模型能力,而是构建一套可编排、可观测、可评测、可持续迭代的 Harness 工程体系。
演讲提纲
1. 问题背景:复杂导购 Agent 为什么不能只靠一次性优化
- 电商导购不是简单问答,而是跨搜索推荐、商品信息、营销优惠、交易履约和售后服务等多个业务域的复杂决策过程。Agent 需要在动态上下文中完成意图理解、任务规划、工具选择和结果整合,任何一个环节发生偏差,都可能导致最终任务失败
- 固定 Workflow 难以覆盖开放式需求,而完全依赖模型自主决策,又容易出现工具误用、参数错误、重复调用和链路失控。因此,复杂业务 Agent 的核心问题逐渐从“如何把链路跑起来”,转向“如何基于真实线上反馈持续变好”
2. 基础建设:让每一次线上执行都可观测、可回放
- 围绕生产级 Agent Harness,建设统一的 Tool 协议、Context/Memory 管理、任务执行控制和全链路 Trajectory 体系
- 重点记录用户输入、上下文组装、规划过程、工具选择、调用参数、工具结果、异常重试和最终输出,并关联模型、Prompt、Tool、配置和知识版本,使线上问题能够被完整还原,为后续归因和优化提供可靠依据
3. 线上轨迹:从海量执行中识别真正的问题
- 将线上执行轨迹、用户反馈、工具异常和业务效果统一采集,结合规则、指标和模型判断发现潜在 Bad Case
- 不仅关注最终答案是否正确,还关注任务是否完成、工具调用是否合理、链路是否冗余、成本与时延是否异常,以及结果是否真正满足用户需求。通过一个典型导购案例,展示 Agent 如何在商品搜索、优惠查询、库存履约和售后判断过程中暴露问题
4. Bad Case 归因:判断问题到底出在哪里
建立面向 Agent 全链路的失败归因体系,将问题拆解为:
- 任务理解与规划错误
- Tool 选择或参数生成错误
- Context 组织与 Memory 召回错误
- 工具执行、超时与异常恢复问题
- 模型推理与约束遵循问题
- 多业务域协同和结果整合问题
结合轨迹回放、同类案例聚类、模型对比和局部重放,判断问题应该通过模型能力、Prompt、Tool、Context/Memory,还是 Runtime 机制进行修复,避免针对单个 Case 不断堆叠规则。
5. 策略变更:从失败原因生成可执行的优化方案
根据归因结果,将优化策略作用到不同层次:
- 调整 Prompt、任务拆解和执行策略
- 优化 Tool 描述、参数 Schema、动态注入和调用策略
- 调整 Context 组装、Token Budget 和 Memory 检索策略
- 增加参数校验、结果校验、重试、降级和人工接管机制
- 必要时调整模型选型、路由策略或进入训练优化
通过版本化管理记录每次策略变更,确保优化对象、适用范围和预期收益清晰可追踪。
6. 回归评测:证明优化不是只修复了一个 Case
- 将典型 Bad Case 和同类问题沉淀为场景化回归集,分别评估单点能力、执行轨迹、任务成功率及业务指标
- 采用新旧版本对照、同一 Case 多次运行和跨场景退化检查,综合评估任务成功率、工具调用准确率、执行步骤、时延和 Token 成本,防止策略只对少量样本有效,或在修复一个问题的同时引入新的退化
7. 灰度上线:让每次变更安全进入真实业务
- 通过小流量灰度、版本隔离和 Champion-Challenger 机制,将通过离线回归的策略逐步放入真实流量
- 持续观察任务成功率、用户反馈、业务转化、链路异常和资源成本;达到预期后逐步放量,出现异常则快速回滚,并将新的线上问题再次进入轨迹采集和归因流程
- 最终形成:线上轨迹 → Bad Case 归因 → 策略变更 → 回归评测 → 灰度上线 → 新轨迹回流
8. 实施效果与核心结论
- 通过这套闭环,导购 Agent 的问题定位从依赖人工排查转向轨迹驱动,效果优化从零散 Case 修复转向体系化迭代,链路稳定性、问题定位效率和版本迭代效率均得到明显提升。
实践痛点
- 在实践中,最大的痛点是复杂业务 Agent 很难同时做到高自主性、高稳定性和低成本。Tool 越多,模型可解决的问题越广,但工具选择、参数生成和跨域结果冲突的概率也会增加;对模型施加更多规则、校验和固定流程,可以提升可控性,却会限制其应对开放式需求的能力
- 其次,长链路任务往往需要多轮推理和多次工具调用,效果提升通常伴随着时延和计算成本上升。为了保证用户体验,必须在信息完整度、执行轮次和响应速度之间做取舍。过早终止可能导致结果不充分,而过度搜索和重试又容易造成无效消耗
- 自进化也并非完全自动化。线上 Badcase 的失败原因常常是模型、工具、数据、上下文和业务规则共同作用的结果,自动归因可能产生错误优化,甚至在修复某类问题时引入新的回归。因此,策略调整仍需要经过离线评测、人工审核和灰度验证
演讲亮点
- 复杂跨域 Tool 的生产级编排:区别于简单问答或单工具调用,本次实践覆盖搜索推荐、商品、营销、履约和售后等多个业务域,通过动态 Tool 注入、参数校验、结果压缩和执行治理,解决复杂链路中的工具选择、数据冲突与稳定性问题
- 基于执行轨迹的 Agent 自进化:区别于依赖人工分析 Badcase 和单点调整 ,我们将线上轨迹、评测结果与用户反馈统一采集,对规划、工具、上下文和模型问题进行归因,并形成“问题发现—策略优化—回归评测—灰度验证”的持续进化闭环
听众收益
- 理解电商导购这类复杂 Agent 场景中,如何在搜索推荐、商品、营销、履约和售后等多域之间通过 Subagent、Skill/Tool 注入完成体系化的 Agent 搭建
- 掌握生产级 Agent 落地中的实践踩坑
- 了解如何基于线上 Badcase、执行轨迹和评测结果,建立从失败归因到策略优化、回归验证和灰度上线的自进化闭环,减少重复试错