随着基础模型能力持续提升,Agent 的实际效果越来越取决于模型之外的运行系统:... 展开 >







蚂蚁资深技术专家,五福红包架构师,有多项技术专利与论文,当前研究方向 Agent 技术与大规模 RL 训推 Scale。
随着基础模型能力持续提升,Agent 的实际效果越来越取决于模型之外的运行系统:它能够看到什么上下文、调用哪些工具、如何保持状态、怎样验证结果,以及发生风险时由谁接管。
本专题聚焦 Harness Engineering——围绕模型构建执行环境、工具接口、上下文与记忆、生命周期编排、可观测性、验证反馈和安全治理,使模型能力能够稳定转化为可靠的生成级的稳定系统。
专题将重点讨论生产级的 Agent、Agent 可读的代码与知识体系、工具协议与安全沙箱、轨迹级可观测性、自动化 Eval、多智能体协作与权限控制,以及基于执行反馈的 Harness 自进化。
我们希望通过来自 Coding Agent、电商 Agent、Data Agent、Train Agent 以及 Agent 基础设施和前沿研究团队的真实实践,回答一个核心问题:当模型不再是唯一瓶颈,工程团队应该如何设计模型之外的系统,才能让 Agent 在生产环境中真正可靠地并自进化?
Agent 进入生产环境后,随着用户量增长,线上 badcase 也会持续增加。蚂蚁阿福上线后同样面临这一问题。从 badcase 的发现、归因和分派,到修复、验证和结果回流,各环节都需要工程师人工衔接。即使有 AI 辅助,处理能力仍不足以应对持续新增的问题。为此,我们分两个阶段推进:先用 Harness Engineering 解决“如何可靠修好 badcase”,再用 Loop Engineering 解决“如何持续修复 badcase”。
第一个问题是:如何减少人工参与,让 Agent 自主完成 badcase 的修复和验证?我们为 Agent 接入开发、部署和评测工具,通过执行约束保障长任务持续运行,再通过评测约束判断问题是否真正修好。在一次真实任务中,Agent 连续迭代 16 轮,改动最终经人工复核后上线。
当修复和验证能够稳定运行后,新的瓶颈随之出现:发现、归因、分派和结果回流仍依赖人工。如何把这些环节也交给 Agent,不再由工程师逐条发起 badcase 修复任务?我们将完整流程组织成两个相互衔接的循环(Loop):内循环负责修复和验证,外循环负责发现、归因、分派和结果回流。两个循环衔接后,系统可以持续处理 badcase;异常改派和最终上线仍由人把关。
本次分享将结合真实案例,展示 badcase 如何入池、分派、修复和验证,并说明当前哪些环节仍需人工决策。
演讲提纲
1. 业务背景与 badcase 处理现状
2. Harness 设计与单 Agent 自主迭代
3. Loop 架构与内外循环协作
4. Agent 小队任务处理与验证流程
5. 落地效果与实践经验
实践痛点
演讲亮点
听众收益
电商导购并非简单的问答或商品检索,而是一个横跨导购决策、搜索推荐、营销优惠、商品信息、交易履约与售后服务等多个业务域的复杂 Agent 场景。我们基于Agent Loop范式构建生产级导购助手,通过统一 Tool 协议、动态上下文管理、任务规划与多域工具编排,让模型能够理解用户隐含需求,并在复杂链路中完成信息查询、商品筛选、优惠计算与服务决策。实践中重点解决了工具数量膨胀、跨域信息冲突、链路超时、错误传播及模型与 Harness 问题难以区分等挑战,并通过轨迹观测、评测回归和策略治理持续优化效果。实践表明,复杂业务 Agent 落地的关键,不只是模型能力,而是构建一套可编排、可观测、可评测、可持续迭代的 Harness 工程体系。
演讲提纲
1. 问题背景:复杂导购 Agent 为什么不能只靠一次性优化
2. 基础建设:让每一次线上执行都可观测、可回放
3. 线上轨迹:从海量执行中识别真正的问题
4. Bad Case 归因:判断问题到底出在哪里
建立面向 Agent 全链路的失败归因体系,将问题拆解为:
结合轨迹回放、同类案例聚类、模型对比和局部重放,判断问题应该通过模型能力、Prompt、Tool、Context/Memory,还是 Runtime 机制进行修复,避免针对单个 Case 不断堆叠规则。
5. 策略变更:从失败原因生成可执行的优化方案
根据归因结果,将优化策略作用到不同层次:
通过版本化管理记录每次策略变更,确保优化对象、适用范围和预期收益清晰可追踪。
6. 回归评测:证明优化不是只修复了一个 Case
7. 灰度上线:让每次变更安全进入真实业务
8. 实施效果与核心结论
实践痛点
演讲亮点
听众收益
DeepSwarm 是小红书技术风险团队构建的通用 RCA Agent 平台,面向容量、变更、异常等场景的故障根因分析,目前以容量根因分析作为首个规模化生产场景。
在运维场景里,Agent Harness 的设计需要兼顾可核对、人机协同与时效性:结论要有证据支撑,不确定时敢说“我不知道”;Agent 能自主调查,也支持人随时核验、补充信息和纠正方向;考虑到值班同学通常只能等待几十秒,需要尽早给出可用判断。这些要求共同影响了 Harness 的设计取舍:如何提高诊断可靠性、减少无效探索,并在有限时间内交付有依据的结果。
分享将展开可观测上下文工程、基于 Session Tree 的诊断过程管理,以及时效性约束下的执行与交付设计:如何将原始观测数据加工成可用证据,如何先建立公共事实、再通过多个分支验证根因假设,如何将固定排查流程封装为工具,并控制上下文规模与结果交接成本。最后结合多维评测、容量场景的验证反馈和真实翻车案例,复盘生产实践中的踩坑,以及何时需要人工核验与介入。
演讲提纲
1. 运维场景下 Agent 的三个设计目标
2. 可观测上下文工程:把原始信号加工成可用证据
3. Session Tree:让诊断过程可追溯,支持多分支探索与人工介入
4. 时效性约束下的执行与交付:两段式下钻与假设验证
5. 多维评测闭环:从一次翻车到系统改进
6. 容量场景的生产验证与展望
实践痛点
演讲亮点
1. 可观测上下文工程:把原始数据加工成可靠的诊断依据
2. Session Tree:让诊断过程可追溯,支持多分支探索与人工介入
3. 时效性驱动的执行:用工具完成固定排查,用多分支验证根因假设
听众收益
多 Agent 把一局网页游戏跑起来并不难。个人练习里,Demo 能进、能打、能结束。难的是把它接进团队:组织认知要转,成本要能评估,边界要去探。
游戏研发里做 Agentic,常见情况是:
我们的实践:Harness 叙事的是接入更多插件,Loop 是为目标不断做减法。先用 Loop Harness 让策划自己把需求拆开、做出来、自动验收,但策划的注意力不该放在质量上,研发不能甩手。再在研发侧把 Build Loop 做成 Build Control:人先在 loop 里拍板,再把人往外抽;一开始目标切错,后面迭代越快越不值得信。工作台基于 DeepSeek Harness。本次分享讲 Demo 之后,Loop 怎么接进团队。
演讲提纲
1. 背景:Demo 能跑,接不进团队
2. 实践:Loop Harness 让策划自己开发需求
3. 实践:研发实践中的 Loop Engineering
4. 实践:工作台,让 loop 有人愿意接着转
实践痛点
认知门槛相对较高,很多人处在Chat、Vibe Coding的状态
前沿亮点
听众收益
AI 已渗透产研链路各个工种,但让这些能力沉淀为组织级的交付效率,仍是 AI Native 组织面临的重要问题。大型需求的成本,多半不在写代码,而在跨角色的反复对齐与验证断点。飞猪交付大脑的解法是打造一条超级流程:把冗长的交付链路收敛为需求对齐、Coding实现、测试验收几个关键阶段,让 Agent 成为流程的第一公民,并串联整条链路。本次分享将拆解这条流程的设计、工程实现与真实效果。
演讲提纲
1. 组织级提效,关键在流程而非工具
2. 交付大脑:把交付链路收敛成一条超级流程
3. 端到端 Loop 的工程实现
4. 案例:一个真实需求的全流程与效果
实践痛点
演讲亮点
听众收益
我们团队承担零售大部分营销相关 H5 页面以及大量中后台页面研发,月均响应约 200 个需求,本次分享将围绕三类真实落地场景,呈现 AI Agent 从“生成”走向“交付”的三次工程化跃迁:第一次跃迁聚焦中后台场景,突破“人工编码”瓶颈,通过“ AI + DSL ”将标准化页面转化为自动化流水线,解决规模化生产效率问题;第二次跃迁深入互动业务场景,Agent 不再单点生成代码,而是串联需求澄清、前后端开发、中后台配置、自动化发布,打通全链路AI化闭环,破解系统协同难题;第三次跃迁攻坚 C 端复杂场景,自研 AI Native 交付级产品,通过 Skill、知识库与 MCP 动态装配,叠加多 Agent “生产—评审”协同机制,让 AI 具备复杂决策与质量自闭环能力,近期 7 天完成 23 个需求交付,平均人工干预仅 2.22 次;而贯穿三次跃迁的 AI 巡检体系,则作为质量底座,确保每一次能力升级都能守住线上稳定性与问题快速响应的底线。希望借此与大家共同探讨 AI 在规模化前端研发中的工程化落地之道。
演讲提纲
1. 为什么 AI 会写代码,却还不会交付
2. 第一次拐点:从代码生成到领域工程
以京东运营中后台自动化交付为例
3. 第二次拐点:从单 Agent 到交付 Loop
以 自研 AI Native 为例
4. 第三次拐点:从交付代码到交付业务结果
以京东互动万花筒 Agent 为例
5. 从三个案例抽象出一套 Agent 交付方法
一套可交付的 Agent 系统需要五个基本要素
6. 总结:衡量 AI 的指标需要改变
实践痛点
前沿亮点
听众收益
随着 Code Agent 开始承担越来越复杂、越来越长程的软件开发任务,仅靠 Harness 提供上下文、工具和执行环境,已经难以保证 Agent 持续稳定地产出结果。如何让 Agent 不仅“完成任务”,还能判断结果、发现问题、自动修正,并通过持续迭代不断提升效果,成为 Agent 工程化落地的新挑战。
本次分享将以网易智企 CodeWave SDD 的实践为例,介绍如何从 Harness 进一步走向 Loop,围绕 Benchmark 评测体系建设、小成本开发试错、自动化智能化迭代、现场可观测 等方面,分享 Agent Loop 的工程实践,包括如何构建评估体系、自动执行与修正任务,以及如何通过可观测和反馈持续优化。同时结合实践中的成本、效果与适用范围,分享 Loop 工程落地过程中的取舍与经验。
演讲大纲
1. 从 Harness 到 Loop:Agent 工程实践的演进
2. CodeWave SDD 的 Harness 实践
3. Benchmark 与评估体系建设
4. 自动执行、问题修正与 Agent 迭代
5. 可观测与持续优化
6. 实践总结:Loop 工程的落地取舍
实践痛点
前沿亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

