专题演讲嘉宾:陈叶超

喜马拉雅数据平台负责人

长期深耕大数据领域,擅长企业级超大规模数据基础设施和AI for Data 和 Data for AI 数据平台体系建设和落地,10年以上大数据平台架构相关团队管理以及实践经验。目前在喜马拉雅负责AI for Data和Data for AI 的 Data Infra、数据引擎、数据平台、数据应用、数据服务和架构相关工作。

by 陈叶超

喜马拉雅
数据平台负责人

随着大模型和 AI Agent 能力不断进化,以 AI 为底座构建下一代智能数据分析系统成为业界共识,喜马拉雅数据团队从 0 到 1 自主研发了更贴近自身业务的 ChatBI ,探索 AI 在实际服务业务的数据分析场景落地。然而在实践中也面临巨大挑战,例如内部数以万计表和数百万列自然语义难以精准召回、企业内部知识和口径理解对齐、大模型幻觉、数据安全、业务对实时反馈提升准确性的要求,用户冷启动难等,这些挑战如果不解决将直接影响业务对 自建 ChatBI 的使用信心导致无法落地。我将重点讨论如何在实践过程中解决以上问数常见的问题,帮助听众更全面地评估选型以建设更贴近业务的 ChatBI。

本次演讲聚焦如下几个方面来解决问题:

  • 如何构建高质量数据集和知识处理来解决海量表字段识别和大模型幻觉问题
  • 如何构建精细的多 Agent 协同系统 ,提升数据集召回、SQL 生成的准确率,解决复杂组织数据权限等问题
  • 如何构建全面的数据评测和全链路反馈体系
  • 构建用户理解和需求引擎,解决用户冷启动困难

演讲提纲

1. 背景和挑战

  • 从业务侧、数据团队、技术发展趋势多角度描述为什么要研发 ChatBI、出发点
  • 市面上已经有那么多的ChatBI 产品了?为什么选择自研,核心差异是什么
  • 海量表无法精准召回、大模型幻觉高、准确性低、评测难等

2. ChatBI 产品与架构

  • 产品和使用
  • 整体架构、各模块协同及关键技术

3. 构建可持续进化 ChatBI

  • 高质量数据集:拆解万表召回的核心解决,如何从企业实际业务触发,设计以业务域为中心的数据集
  • 知识处理优化经验实践:降低模型幻觉的核心,知识处理优化,以及业务共建知识库和数据集而不是闭门造车
  • 构建多 Agent 协同优化:多 Agent + 上下文工程 + Tool 工具,Agent 协同提升系统能力
    • 数据集路由 Agent:基于语义相似度+业务域自动选择数据集(解决海量表检索问题)
    • 多垂类改写 Agent:精细化动态解析用户真实需求(如“环比”自动适配T+1数据规则)
    • SQL 生成 Agent: SQL 方言语法适配、多表关联、SQL 生成、SQL Review、自动纠错、工具取数、权限控制
    • 评测 Agent:自动化评测驱动精准优化
    • 用户理解 & 需求识别反馈 Agent:深度解读用户 Query,持续构建高质量数据集、冷启动、提升用户粘性、提高数据持续探索
    • 工具调用:数据查询、数据安全处理、日志 Trace 等,能力复用,守住安全底线
  • 构建评测体系:多维度准确性智能评测、人工标注、AI 标注
  • 多智能体协同的 ChatBI 数据洞察、智能异动分析诊断
  • 整体的落地情况如何?准确度、产运营使用覆盖度,以及 ChatBI 结合 MCP 和 Agent 平台构建 ChatBI 生态
  • 构建可持续进化的 ChatBI :高质量数据集、更智能的 Agent、用户交互反馈

4. 未来展望和规划

演讲亮点

  • 从高质量数据治理和构建、企业知识处理和优化、多智能体 Agent 构建 、评测反馈多角度提高智能问数准确性,提升用户理解、提高数据集消费
  • 拆解从 0 到 1 ChatBI 核心链路全流程,更贴近业务场景的真实案例和遇到的实际挑战和解决方案
  • 从产品设计和研发、数据集构建和知识处理、运营等多角度阐述如何在企业中落地

听众收益

  • 可复用的架构设计:如何从 0 到 1 构建一个完整的 ChatBI 系统,提供了一整套可以落地的核心架构和关键流程
  • 避坑指南:如何避坑万表召回、企业知识治理、多智能体 Agent 协同、数据安全处理、构建客观真实评测体系注意事项
  • 多智能体驱动的 ChatBI 如何持续迭代:高质量数据集、更智能 Agent、交互反馈自动进化系统等

交通指南

上海浦东滨江喜来登酒店

SHERATON SHANGHAI PUDONG RIVERSIDE
地址:上海浦东大道2288号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手