专题演讲嘉宾:赵雨森

网易智企技术专家

网易智企技术专家,CodeWave 智能开发平台架构师。12 年软件开发经验,长期从事 AI Engineering 方向,拥有多项技术专利。负责全栈可视化编程语言(NASL)的设计和核心语言设施的开发,负责可视化编程与 Vibe Coding、Spec Driven 等 AI Agent 技术的融合落地与效果提升。

by 赵雨森

网易智企
技术专家

随着 Code Agent 开始承担越来越复杂、越来越长程的软件开发任务,仅靠 Harness 提供上下文、工具和执行环境,已经难以保证 Agent 持续稳定地产出结果。如何让 Agent 不仅“完成任务”,还能判断结果、发现问题、自动修正,并通过持续迭代不断提升效果,成为 Agent 工程化落地的新挑战。

本次分享将以网易智企 CodeWave SDD 的实践为例,介绍如何从 Harness 进一步走向 Loop,围绕 Benchmark 评测体系建设、小成本开发试错、自动化智能化迭代、现场可观测 等方面,分享 Agent Loop 的工程实践,包括如何构建评估体系、自动执行与修正任务,以及如何通过可观测和反馈持续优化。同时结合实践中的成本、效果与适用范围,分享 Loop 工程落地过程中的取舍与经验。

演讲大纲

1. 从 Harness 到 Loop:Agent 工程实践的演进

  • 从 Vibe Coding 到 SDD:开发流程的变化
  • Harness 在实际应用中的问题与人工介入
  • 执行、验证、修正的 Loop 设计

2. CodeWave SDD 的 Harness 实践

  • 需求拆解与 Spec 驱动开发
  • 上下文、工具与执行环境设计
  • 大规模 SDD 任务的执行与优化

3. Benchmark 与评估体系建设

  • Code Agent Benchmark 的数据集构建与管理
  • LLM-as-Judge、Rule-based、SWE Style、Hybrid 等评估方式
  • 测试结果量化与问题定位

4. 自动执行、问题修正与 Agent 迭代

  • 自动化任务执行与测试评估
  • 基于评测结果的问题分析与 Auto Correction
  • 执行—评估—修正—重跑的闭环
  • 分数驱动的 Agent 策略迭代与成本控制

5. 可观测与持续优化

  • Agent 执行过程的监控与告警
  • 执行链路追溯与结果回放
  • 线上问题反馈与迭代优化

6. 实践总结:Loop 工程的落地取舍

  • Loop 工程的适用场景与前置条件
  • Benchmark 规模、评估质量与自动化程度的平衡
  • 自动化收益与 Token、算力等成本的权衡
  • 从 Harness 到 Loop 的实践路径与经验

实践痛点

  • 合理评估 ROI,选择合适的范围进行实施
  • Benchmark 需要有一定的规模化样本

前沿亮点

  • 控制论角度的 Loop 工程方法:区别于把 Loop 讲成“定时触发、worktrees、连接器”等工具组合的解读,本议题给出“环工程的核心思想 + 环分析法 + 多视角诊断”的可复用框架,并用它驱动分析全部实践内容
  • 面向复杂 Agent 的分层 Benchmark 与混合评估体系:覆盖全流程阶段的测试集,结合 LLM-as-Judge(Rubric)、SWE Style、Rule-based、Hybrid 等多种评估策略,构建完善的测评体系
  • 分数驱动的 Agent 自我迭代机制:把“自动化执行 + 自动化测评 + 智能化修复”组成闭环,让 Agent 在受控边界内做低成本自我迭代
  • 长程任务的稳定性提升与 Harness Loop 工程实践经验

听众收益

  • 一套判断闭环是否真正成型的检查方法
  • Agent 自我迭代的落地条件与边界
  • 可借鉴的评估与度量体系设计经验
  • 从 Harness 走向 Loop 的实施路径和经验

交通指南

上海建工浦江皇冠假日酒店

Shanghai Construction Group Pujiang Crowne Plaza Hotel
地址:上海市闵行区陈行公路 3701 号
  • 微信咨询

  • 电话咨询

    联系电话:18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手