Harness、Loop 与 Graph:Agent 产品设计的演进之路

会议室:待定
出品人:延君晨

Agent 不只是技术问题,更是产品问题。过去一年,Agent 的构建范式经历了... 展开 >

专题出品人:延君晨

ATEVE联合创始人兼 COO / 前 Dify 联合创始人

ATEVE 联合创始人兼 COO / 前 Dify 联合创始人,十余年产品架构及商业化经验。涉足在线教育、OTA、电商零售、生命科学等多个领域。

专题:Harness、Loop 与 Graph:Agent 产品设计的演进之路

Agent 不只是技术问题,更是产品问题。过去一年,Agent 的构建范式经历了从 Prompt 到 Loop 再到 Graph 的持续上移:Loop 让 Agent 学会自我验证,Graph 让多 Agent 走向组织化分工,而 Harness——围绕模型构建的执行系统——把这一切沉淀为可驾驭、可观测、可治理的工程体系。技术范式的每一次跃迁,都在重写产品设计的底层假设:人机协同的交互形态、Agent UX 的评估标准、可信反馈的机制设计、意图驱动的界面范式,乃至技术团队的组织方式,都在被重新定义。

本专题聚焦 AI Native 产品设计,从技术演进与组织变革的双重视角,探讨 AI 时代产品形态将如何变化,以及"可用、可信、可协作"的 Agent 产品该如何被设计。

by 俞昊晟

Cherry Studio
商业化合伙人、FDE 负责人

通用 Agent 正在快速变强:模型能够调用更多工具,Runtime 能够持续运行,插件生态也能迅速补齐能力。但企业真正采购的不是“能调用更多工具”的 Agent,而是一个可验收、可接管、可治理,并能持续创造业务价值的工作系统。
传统工作流把每一步路径画死,会牺牲 Agent 的探索能力;完全放任 Agent,又会带来目标漂移、状态不可追溯、权限失控和责任不清。本次分享将提出一个面向企业落地的三层 Harness 框架:基础工具调用、通用 Agent Runtime、垂直业务 Harness,并拆解模型—工具的小循环,如何嵌入目标—Spec—动态 DAG—执行—验证的业务大循环。
在产品控制层面,分享将说明如何用 Skill、MCP、Hook 构成从软提示到强约束的控制梯度;如何让 Graph 不再是预先画死的流程图,而是根据当前任务动态生成的依赖、权限、责任和验收结构;以及如何在保留 Agent 探索能力的同时,让执行过程可观察、失败可恢复、结果可验证。
案例部分将结合 Cherry Studio 的公开架构与真实企业落地经验:一个覆盖 300+ 门店的对账案例,将说明 FDE 如何把模糊业务转化为输入契约、领域规则、异常状态、证据链和人工确认机制;一个近 200 人、建设约 22 个内部应用的企业案例,则会解释为什么应用数量增长并不必然带来员工采用。
同时,分享将引入 Anthropic Research 多 Agent 系统、OpenAI × Thrive Tax AI 和 Intercom Fin 等公开案例,分别讨论复杂 Agent 编排的成本边界、专家修正如何进入 Trace 与 Eval,以及企业 Agent 如何定义可计量、可争议、可撤销的商业结果。
最终,分享将回答一个商业化问题:当模型、工具和通用 Runtime 逐渐成为公共供给,企业为什么仍会为业务 Harness 持续付费,以及 FDE 如何把客户现场的异常和经验沉淀为可跨客户复用的产品能力。

演讲提纲:

  1. 通用 Agent 越强,为什么越需要业务 Harness
    • 从一个“Agent 技术上已经完成、业务上却无法验收”的任务切入。
    • 固定工作流与完全自主 Agent 的两种失败:前者没有探索空间,后者没有责任边界。
    • 核心判断:企业采购的不只是模型能力,也包括持续结果、风险边界和组织责任。
  2. 三层 Harness——真正的产品与商业价值在哪里
    • 基础工具调用:让模型能够访问外部世界。
    • 通用 Agent Runtime:提供文件、终端、Session、Loop、恢复和通用工具。
    • 垂直业务 Harness:定义业务状态、领域上下文、里程碑、权限、验收和人机界面。
    • 以开放插件底座说明生态供给如何被释放,以及生态热度与产品成熟之间的距离。
    • 结合 Cherry Studio 的 Session、Job、渠道、工具批准、Usage 和 Trace 等公开架构,说明通用工作台向业务 Harness 演进需要哪些控制点。
    • 区分“源码已实现”“企业端到端已验证”和“商业结果已验证”,避免把功能清单直接等同于企业价值。
  3. 两个 Loop——把 Agent 小循环装进业务大循环
    • 小循环:模型 → 工具 → 结果 → 下一步,时间尺度通常是秒到分钟。
    • 大循环:目标 → 澄清 → Spec → 动态 DAG → 执行 → 验证,时间尺度可能是小时到天。
    • 通过 Idea → Proposal → 动态 DAG → Execute → Verify,解释如何用“AI 提案、人类验证”组织完整业务交付。
    • 对照 Anthropic Research 的 Orchestrator–Worker 架构,说明复杂任务为什么需要动态拆分,而不是预画固定路径。
    • 同时讨论复杂架构的 Token 和运行成本:只有高价值、可并行、跨上下文的任务,才值得使用更复杂的 Agent 编排。
    • 将人的注意力“逻辑左移”到目标、任务拆解和验收标准,而不是在执行过程中逐步遥控 Agent。
  4. 三层约束——Skill 指路,MCP 限接口,Hook 管生命周期
    • Skill:提供可复用的 SOP、提示与经验,主要承担说服和导航。
    • MCP:提供领域工具和 Tool-based State,限制 Agent 能够调用的业务接口。
    • Hook:在任务开始、任务完成和高风险工具调用等生命周期节点进行拦截、批准或上下文注入。
    • 通过业务工具事件形成动态 Hook,使底层 Runtime 不必预先知道全部业务节点。
    • 用“里程碑强收束+过程中持续校准”,解决长任务中的目标漂移和假完成问题。
  5. Graph——画边界,而不是画死路径
    • 动态 DAG 应由当前 Spec 生成,而不是由产品经理预先硬编码全部连线。
    • DAG 同时表达任务依赖、权限、责任和验收标准。
    • 节点之间保留 Agent 的探索自由,在关键里程碑收束“世界线”。
    • 状态机同时约束人和 Agent,Review Agent 提供相对独立的结果验证。
    • Agent UX 应展示任务状态、证据、高风险批准和恢复入口,而不是暴露无意义的内部推理过程。
  6. 从企业采用到商业复用
    • 流程成熟的大企业:Agent 应先进入既有 Workflow,以最小侵入的方式成为流程加速器。
    • 数字基础薄弱的中小企业:可以围绕 Agent 重建数据和流程,将其作为业务数字化重建的机会。
    • Headless、工作渠道和可视化看板的选择,取决于谁负责发起、观察、批准和验收任务。
    • FDE 的职责不应停留在定制交付,而要把现场异常沉淀为状态、领域工具、Hook、验收标准和模板。
    • 用交付时长、跨客户复用率和贡献毛利,检验 FDE 经验是否真正完成产品化。
    • 以 Intercom Fin 为商业化微案例:先定义什么是可计费、可争议、可撤销的有效 Outcome,再讨论 Agent 的结果定价。
  7. 现场深案例、外部镜像与组织反例
    • 案例一:300+ 门店对账
      • 输入包括 ERP 汇总和各商场结算单,真正难点是批量上传后仍能按照商场、月份和门店准确匹配。
      • 当业务规则尚不清楚时,由 Agent 从代表性样本中尝试归纳对账逻辑,并输出判断理由和差异证据。
      • 将销售额、扣点、日期和商场等稳定规则沉淀为确定性脚本或状态机,避免每次重新让模型猜测。
      • Agent 或 OCR 负责读取、归一、初步匹配和证据归集;最终追账、沟通和财务确认仍然由人负责。
      • 从单份演示扩展到 300+ 门店,需要继续解决批量处理、总部汇总、存储、权限、失败恢复和完整验收。
    • 团队案例数据:原人工对账约需 1—2 人天,应用后缩短到数小时;单份现场演示约 5—10 分钟,特定模型配置下模型费用约 0.14 元。后两项属于演示观察,不作为生产 SLA 或完整交付成本。
    • 商业化解释:客户采购的不是一次 OCR 或模型推理,而是规则发现、异常工作重分配、证据链和持续运营的业务 Harness。
    • 外部镜像:OpenAI × Thrive Tax AI
      • 面对多源、非标准数据,系统先将源文件归一为带出处的字段,再映射进专业系统,最终由专家审核。
      • 保留来源、模型预测、最终结果和专家修改的完整 Trace,区分提取错误、映射错误、暂不支持和正常工作噪音。
      • 将重复、可行动的差异沉淀为 Eval,再转化为有证据、可验收的产品改进任务。
      • 人工复核不是 Agent 失败后的补丁,而是业务 Harness 持续学习和改进的接口。
    • 组织反例:近 200 人企业,22 个应用为什么仍不等于采用
      • 企业从管理层认知、工具试验、建设 8—10 人兼职 AIBP 队伍,逐步走向 WebApp 产品化。
      • 阶段性建设约 22 个内部应用,但仍出现技术门槛、执行黑箱和 Agent 入口碎片化。
      • 缺少统一入口、运行状态、验收机制和业务 Owner 时,Skill 和应用供给越多,员工的选择成本可能越高。
      • 应用数量不等于采用。只有业务持续提出问题、中间层持续交付、员工重复使用、有效方案回流产品,才可能形成续费和规模化。
  8. 结论——三层、两环、三约束、双闭环
    • 三层 Harness:工具调用、通用 Runtime、垂直业务 Harness。
    • 两个 Loop:模型—工具小循环、目标—验收业务大循环。
    • 三层约束:Skill、MCP、Hook。
    • 运行闭环:目标 → Spec → 动态 DAG → 行动 → 验证 → 接管或恢复 → 交付。
    • 商业闭环:场景 → 激活 → 重复使用 → 可计量价值 → 续费 → 跨客户复用。
    • FDE 连接两个闭环:把现场异常沉淀进 Harness,让 Harness 降低下一次交付成本。

实践痛点

  1. 通用 Agent 与真实业务之间存在断层:Agent 会调用工具,却不了解企业的业务状态、责任边界和验收标准,容易出现“技术上完成、业务上无法交付”。
  2. 自主性与可控性难以兼得:固定工作流会限制 Agent 的探索能力,完全自主又容易产生目标漂移、权限失控和“假完成”,产品需要找到合适的边界与约束机制。
  3. 现场交付难以沉淀为产品能力:不同企业的流程成熟度差异很大,如果 FDE 经验不能转化为可复用的状态、规则、工具和验收模板,客户越多,交付成本反而越高。

内容前沿亮点

  1. 提出“工具调用—通用 Runtime—垂直业务 Harness”三层模型,解释为什么真正承载企业价值和商业化结果的是第三层业务 Harness。
  2. 用“Agent 小循环嵌入业务大循环”的方法,将模型与工具的秒级行动纳入目标、Spec、动态 DAG、执行和验证的完整业务生命周期。
  3. 将 Skill、MCP、Hook 组织为从软提示到强约束的控制梯度,并用真实企业案例说明如何把技术质量连接到业务采用、可验证结果、续费依据和交付复用。

听众收益

  1. 获得一套三层业务 Harness 产品地图,用于判断哪些能力属于通用 Agent,哪些必须进入垂直业务层设计。
  2. 掌握“大小两个 Loop+动态 DAG+Skill/MCP/Hook”的设计方法,在保留 Agent 探索能力的同时,使权限、过程和结果可控、可验收。
  3. 带走一套业务 Harness 落地检查框架,从技术质量进一步评估任务采用、业务价值、FDE 复用和单位经济,避免用 Demo 或功能数量代替真实商业结果。

by 施宏斌

Frontier
联合创始人

当 Agent 从 Coding 走向非 Coding 领域,高价值的金融 Agent 也需要从事实问答进一步走向研究、判断与决策。但金融市场中的很多关键问题并不存在唯一、客观且稳定的答案,判断结果还会随市场状态持续变化。我们的核心判断是:在动态、开放的问题域中,真值并非不存在,而是分散在规则、专家意见、市场环境与时间验证之中。
本次分享将结合真实金融任务,介绍如何将离线规则、市场态势、专家意见与时间验证组成 Eval 闭环,并进一步探讨 HITL(Human-in-the-Loop)与过程透明度如何进入 Agent 的评估与产品设计:不仅评估最终答案,也将证据组织、判断过程与人工反馈等作为可观测目标和交付结果的一部分。

演讲提纲:

  1. 金融开放问题为什么不能沿用静态问答 Eval
  2. 重新定义评测单元:从 Question–Answer 到 Decision Episode
  3. 环境反馈:Harness 如何让市场状态进入 Agent 的评估与决策过程
  4. 人机协作:专家、用户与时间验证如何共同参与 Agent 的判断闭环
  5. 边界:这套方法不能解决什么?

实践痛点:

  1. 数据准备:如何处理专家成本、专家偏差,以及开放性、主观性问题的定性与评价。
  2. 环境构建如何在动态市场环境中兼顾真实性、可冻结与可复现性。
  3. 问题定义:如何有效区分“做对”与“做好”两类问题,并为后者建立有说服力的评价框架。

前沿亮点:

  1. 区别于以标准答案为核心的静态 Benchmark,本方案以 Decision Episode 为评测单元,从最终答案进一步扩展到 Agent 的完整判断过程。
  2. 将过程透明度引入 Agent UX,使 Agent 处理市场噪音、组织证据、形成判断与行动的过程可观察,并将其作为交付质量的一部分。
  3. 专家不再只参与答案标注和结果评分,而是作为人机协作闭环的一部分进入 Agent 的判断与验证过程,并通过共识度等方式参与评价。

听众收益:
以 Earning Call 处理等真实金融 Agent 场景为切入,听众将:

  1. 了解非 Coding Agent 在动态、开放问题中的真实评估困境,以及 Decision Episode、环境反馈与时间验证等实践方法。
  2. 作为个人投资者 是如何思考以及当前资本市场参与者真实 workflow

by 张凯寓

43 AI
联合创始人

模型升级了,为什么生意未必升级?当 Agent 已经能够调用工具、组合方法,甚至现场构建解决方案,产品团队应该把力气花在哪里?

本次分享将以用户级 Harness 在若干真实企业高价值场景中的实际演示为切入,展示业务知识与专业经验如何进入 Agent 的执行过程,形成用户自己的工作系统;结合 CLOAK 在三个月内迭代 80 个版本的探索与取舍,复盘产品判断如何被真实使用不断修正:哪些需求值得做成产品,哪些解决方案可以由用户与 Agent 共同构建,以及如何在快速变化中,既赚今天的钱,又造明天的生意。

演讲提纲:

  1. 模型升级了,为什么生意未必升级?
    • 模型能力决定“什么可以做”,业务条件决定“什么能够落地”。 借助 Pace Layering 的视角,理解技术、组织、制度与人的行为为何以不同速度变化,以及这种速度差如何影响 AI 的实际应用
    • 瓶颈已经转移,产品投入也需要随之调整。 当主要障碍转向业务信息、判断标准与工作衔接,继续扩充通用能力,并把其余适配工作留给用户,未必能带来相应的业务价值
    • 生成越来越快,整件事却可能仍然很慢。 从端到端(End-to-End)任务链审视准备、执行、审核、返工与交付,判断一次能力升级究竟改善了什么,以及创造了哪些过去无法实现的可能性
  2. 走进企业现场:用户级 Harness 如何让经验成为能力
    • 复用通用执行机制,建设用户自己的工作条件。 结合真实企业场景,说明系统级与用户级 Harness 的分工:通用机制持续演进,具体业务的背景、方法与标准也需要持续建设
    • 从五层模型理解 Harness 如何支撑完整任务。 围绕 Context、Memory / State、Tools / Skills、Rules / Permissions、Evals / Recovery,拆解 Agent 此刻看到什么、跨步骤保留什么、如何行动、受到什么约束,以及如何验收和处理失败
    • 保存了经验、找到了经验、经验改善了执行,是三件不同的事。 通过实际演示,呈现业务资料、专业方法与规则如何进入执行过程,观察关键经验怎样改变 Agent 的行动与结果
    • 让执行有依据,让结果可评估,让失败可恢复。 结合 Agent Loop 与 Workflow,区分规则指导、运行时权限和程序检查;通过评估、纠错与恢复,将有效反馈用于优化后续执行,让一次任务留下可复用的积累
  3. 三个月、80 个版本:CLOAK 的产品边界与迭代取舍
    • 通用产品可以规模化支持差异,不必预先写好所有解决方案。 当 Agent 能够组合工具、Skills 与上下文,部分解决方案可以在使用中形成。重新判断哪些需求应做成固定功能,哪些可以由用户与 Agent 共同构建
    • “允许定制”与“用户能够完成定制”之间,仍然有大量产品工作。 从个人实践走向团队采用,产品需要帮助用户表达经验、接入知识、修正方法。不能把尚未解决的使用成本,全部转化成对用户自觉性的要求
    • AI 让实现更快,也让未经验证的判断更快变成产品。 结合 80 个版本的探索与取舍,区分功能完成、问题解决、持续采用与商业成立;用可运行样例减少实现歧义,用真实使用反馈修正产品方向
    • 工具可以换,用户积累的资产应当留下。 底层模型与执行框架持续演进,产品需要辨认哪些实现应该替换,哪些业务知识与工作方法值得保留。竞争力来自帮助用户用好资产,并持续降低使用与维护成本
    • 赚今天的钱,又造明天的生意。 阶段性方案需要交付现实价值,长期方向也要接受现实检验。让每次开发既产生眼前结果,也留下可复用的能力与被真实反馈修正的判断

实践痛点:

  1. 能力与结果脱节: 模型持续升级,业务信息、质量标准与工作衔接仍需用户反复补齐
  2. 经验难以稳定生效: 资料、Skills 与规则已经建立,但执行、验收与失败处理尚未形成完整闭环
  3. 个人可用难以转化为团队采用: 上下文整理、学习与协作成本阻碍持续使用,快速发版也难以证明价值

前沿亮点:

  1. Harness 五层模型与企业场景演示: 从 Context、Memory / State、Tools / Skills、Rules / Permissions 到 Evals / Recovery,展示完整工作系统的构成与协同
  2. 从经验注入到评估优化: 将专业知识、行为规则、执行评估与失败恢复纳入同一任务过程,讨论反馈如何转化为可持续改进的工作方法
  3. AI Native 产品边界与高频迭代实践: 结合 CLOAK 三个月、80 个版本的探索,讨论用户参与构建解决方案后,产品设计与交付方式如何变化

听众收益:

  1. 运用 Pace Layering 与端到端任务视角,识别 Agent 落地的真实瓶颈
  2. 掌握 Harness 五层模型的分析框架,理解专业经验如何进入执行、评估与改进过程
  3. 获得 AI Native 产品的边界判断与迭代思路,区分功能进展、用户价值与商业验证

交通指南

上海建工浦江皇冠假日酒店

Shanghai Construction Group Pujiang Crowne Plaza Hotel
地址:上海市闵行区陈行公路 3701 号
  • 微信咨询

  • 电话咨询

    联系电话:18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手