当 Agent 从 Coding 走向非 Coding 领域,高价值的金融 Agent 也需要从事实问答进一步走向研究、判断与决策。但金融市场中的很多关键问题并不存在唯一、客观且稳定的答案,判断结果还会随市场状态持续变化。我们的核心判断是:在动态、开放的问题域中,真值并非不存在,而是分散在规则、专家意见、市场环境与时间验证之中。
本次分享将结合真实金融任务,介绍如何将离线规则、市场态势、专家意见与时间验证组成 Eval 闭环,并进一步探讨 HITL(Human-in-the-Loop)与过程透明度如何进入 Agent 的评估与产品设计:不仅评估最终答案,也将证据组织、判断过程与人工反馈等作为可观测目标和交付结果的一部分。
演讲提纲:
- 金融开放问题为什么不能沿用静态问答 Eval
- 重新定义评测单元:从 Question–Answer 到 Decision Episode
- 环境反馈:Harness 如何让市场状态进入 Agent 的评估与决策过程
- 人机协作:专家、用户与时间验证如何共同参与 Agent 的判断闭环
- 边界:这套方法不能解决什么?
实践痛点:
- 数据准备:如何处理专家成本、专家偏差,以及开放性、主观性问题的定性与评价。
- 环境构建如何在动态市场环境中兼顾真实性、可冻结与可复现性。
- 问题定义:如何有效区分“做对”与“做好”两类问题,并为后者建立有说服力的评价框架。
前沿亮点:
- 区别于以标准答案为核心的静态 Benchmark,本方案以 Decision Episode 为评测单元,从最终答案进一步扩展到 Agent 的完整判断过程。
- 将过程透明度引入 Agent UX,使 Agent 处理市场噪音、组织证据、形成判断与行动的过程可观察,并将其作为交付质量的一部分。
- 专家不再只参与答案标注和结果评分,而是作为人机协作闭环的一部分进入 Agent 的判断与验证过程,并通过共识度等方式参与评价。
听众收益:
以 Earning Call 处理等真实金融 Agent 场景为切入,听众将:
- 了解非 Coding Agent 在动态、开放问题中的真实评估困境,以及 Decision Episode、环境反馈与时间验证等实践方法。
- 作为个人投资者 是如何思考以及当前资本市场参与者真实 workflow