专题演讲嘉宾:刘三亚

滴滴出行资深软件开发工程师

2018 年毕业于电子科技大学,毕业后加入滴滴,长期深耕大数据领域。

现任职滴滴数据平台与应用部-数据资产平台资深软件开发工程师。主要负责滴滴数据地图、元数据仓建设以及数据治理相关工作,通过持续建设与完善元数据,推动落地相关治理能力栈(健康分模型、血缘、治理工作台等),进行大数据全域( Hadoop、ES、Flink 、OLAP 等)治理。

by 刘三亚

滴滴出行
资深软件开发工程师

针对企业 Hive 元数据缺失、数据资产“搜不到、看不懂”的痛点,本次分享我将介绍基于 LLM 的元数据自动化增强与语义检索实践。通过 LLM 深度解析 DDL、SQL 血缘及 ETL 代码,配合精细化 Prompt 工程实现表/字段描述的规模化补全;并利用增强后的元数据,构建“向量+关键词”双路召回模型,辅以语义重排序(Re-rank)与生成式检索,将传统词汇匹配升级为业务意图理解。

演讲提纲

1. 背景与挑战:传统元数据治理的困局

  • Hive 仓库中大量“僵尸表”、字段描述缺失(覆盖率低),人工维护成本高,开发者注释意愿低
  • 传统基于关键词的搜索(Elasticsearch)高度依赖文字匹配,业务人员“搜不到、看不懂”
  • 大模型契机:利用LLM现元数据自动化补全,并将搜索体验从“搜词”升级为“搜意图”

2. 基于 LLM 的元数据自动化增强

  • 构建“ DDL + SQL 血缘+数据采样”的多模态上下文,引导 LLM 生成精准描述
  • 通过提示词工程(Prompt Engineering)与长文本压缩,防止模型上下文溢出

3. 数据资产智能检索实践

  • 构建“向量+关键词”双路召回模型,结合语义重排序提升命中率。
  • 交互体验的提升:从“搜索框”到“检索顾问”

4. 总结与未来展望

您认为,这样的技术在实践过程中有哪些痛点?

  • 利用大模型补全缺失的元数据信息,如何提升其准确率
  • 如何将传统检索技术与大模型结合,生成业务可理解的检索结果摘要

演讲亮点

  • 对于元数据缺失信息的补全与增强,利用大模型给了一种新的思路

听众收益

  • 了解如何利用大模型对已有元数据的缺失信息进行补全

交通指南

北京富力万丽酒店

Renaissance Beijing Capital Hotel
地址:北京市朝阳区东三环中路61号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手