专题演讲嘉宾:赵恒

Datus.AI创始人

赵恒,Datus.AI 的创始人,StarRocks TSC member。从阿里的数据库开发工程师到多个开源项目的连续创业者。 华中科技大学计算机本硕,毕业在阿里巴巴从事分布式数据库开发,后在数据领域持续创业,深入数据分析市场的开拓和研究。

by 赵恒

Datus.AI
创始人

在一年多的开源 Data Engineering Agent 实践中,我们从第一天就引入 Semantic Layer,希望通过统一指标口径提高 Agent 的查询准确性。但随着任务从“查询一个指标”走向“解释业务变化”甚至指导业务决策,新的问题逐渐出现:指标查询与明细探索之间语义不连贯,多表关联可能造成重复计数,复杂归因的稳定性和效率,以及基于语义层的本体构建。

本次分享基于 Datus 与 Dosi 的工程实践,以“某项业务指标为什么下降”为贯穿案例,介绍从 MetricFlow 到 Apache Ossie 的技术选择,以及如何将语义模型编译为可执行 SQL、设计支持探索与纠错的 Agent 工具接口,并通过参数化指标、窗口语义和 Ontology 支持从指标到业务对象的连续分析。最后讨论如何验证查询正确性与分析过程,呈现 AI Native Semantic Layer 的实现方法、工程取舍与适用边界。

演讲提纲

1. 从“查出指标”到“解释变化”:传统 Semantic Layer 在 Agent 场景中的不足

  • 一年 Data Engineering Agent 实践:为什么从 Day 1 就引入 Semantic Layer,以及它解决了哪些口径一致性问题
  • 拆解一个分析任务:“收入为什么下降?”如何从指标查询,逐步进入维度拆解、订单明细与原因验证
  • 实践中遇到的断点:指标与明细查询脱节、多表关联导致重复计数、衍生指标膨胀,以及失败后反复尝试 SQL
  • 从 MetricFlow 到 Apache Ossie:区分现有实现的限制、语义表达的不足与开放标准的需求,说明调整指标定义规范选型的原因

2. 构建可执行的 Semantic Runtime:一个轻量 SQL 编译器的工程实现

  • 从语义模型到 SQL:以一条查询为例,拆解模型解析、校验、中间表示、关联路径选择、聚合规划与多方言生成
  • 如何避免“SQL 能执行,但结果不正确”:围绕粒度、关联基数与 fan-out,讨论预聚合、半连接等策略的选择及边界
  • 如何精简指标体系:用参数化指标、派生表达式和窗口语义组合表达同环比构建一个可追溯的指标树而非几千个离散的指标和 RAG
  • 面向 Agent 高频调用的工程取舍:模型复用、编译开销,以及语义层与数据库执行引擎的职责划分

3. 让语义层进入 Reasoning Loop:Semantic Tools 与 Ontology Tools 如何设计

  • 工具如何支持完整分析过程:围绕“发现模型—查询指标—下钻明细—归因—验证”设计输入、输出与调用边界
  • 为什么需要在 Metrics Query 与 Detail Select 之间切换:让 Agent 查询指标后,能够沿用业务定义与关联关系检查具体对象
  • Ontology 如何参与查询执行:将 Objects、Properties、Relationships 映射到语义模型,使业务对象及关系能够被发现、查询和遍历
  • 如何帮助 Agent 从失败中恢复:通过结构化错误、参数约束和可解释的执行结果,支持修正查询与验证假设

4. 端到端案例复盘:从业务问题到可验证的分析结果

  • 构建案例所需的语义上下文:利用已有 Schema、SQL 和业务文档,明确模型、指标、对象关系,以及需要人工确认的业务口径
  • 展示完整分析链路:从“收入下降”出发,完成趋势查询、维度拆解、明细检查和归因,呈现实际工具调用与生成的 SQL
  • 对照不同实现路径:比较直接生成 SQL、仅使用指标查询接口和完整 Semantic Runtime 在同一任务中的表现,分析错误出现在哪里、如何被发现和修正
  • 验证方法与实践边界:检查结果正确性、关联后的聚合一致性、工具调用次数和耗时,并讨论语义定义错误、数据质量与业务因果判断仍需如何处理

实践痛点

  • 指标查对了,不代表分析链路可靠。 Agent 从聚合指标下钻到明细、跨表关联时,容易丢失原有口径或改变计算粒度,产生结果合理但实际错误的分析
  • 业务语义分散,接入成本高。 Schema、历史 SQL、指标平台和业务文档各自承载部分定义,将它们转化为可执行、可维护的统一模型,需要解决冲突与人工确认问题
  • 固定指标难以覆盖动态探索。 时间窗口、筛选条件与派生计算不断组合,容易造成指标数量膨胀,也增加 Agent 选择和理解指标的难度
  • 工具能调用,但不容易纠错。 模糊的错误信息和缺少约束的接口,会让 Agent 反复尝试;如何同时支持探索、确定性执行与过程验证,是关键工程挑战

演讲亮点

  • 用一条完整分析链路串联技术。 从业务问题出发,展示指标查询、明细探索与归因之间的真实断点,以及对应的实现方式。
  • 深入轻量语义 SQL 编译器的内部。 从数据库 Planner 的视角讲解语义校验、关联与聚合规划、多方言生成,重点讨论查询正确性。
  • 给出面向 Agent 的工具接口设计。 具体讨论 Metrics Query、Detail Select、Ontology 查询及结构化错误如何配合 Reasoning Loop。
  • 通过对照与失败案例明确边界。 展示哪些问题可以由语义层保证,哪些仍需要数据治理、业务确认或 Agent 进一步验证。

听众收益

  • 能够识别现有 Semantic Layer 在 Agent 分析任务中的具体缺口,判断何时复用、何时扩展
  • 理解从开放语义模型到可执行 SQL 的实现路径,以及粒度、关联与聚合正确性的关键控制点
  • 获得可参考的 Semantic Tools 与 Ontology Tools 设计方法,支持指标与明细之间的连续探索
  • 掌握一套验证 Data Agent 语义分析链路的方法,从结果正确性、纠错能力和执行成本评估实际效果

交通指南

上海建工浦江皇冠假日酒店

Shanghai Construction Group Pujiang Crowne Plaza Hotel
地址:上海市闵行区陈行公路 3701 号
  • 微信咨询

  • 电话咨询

    联系电话:18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手