周康,小米数据开发平台负责人,目前主要负责小米集团的统一数据开发平台建设。Apache Gravitino PPMC。研究方向:OLAP 引擎、统一元数据、数据平台。

周康,小米数据开发平台负责人,目前主要负责小米集团的统一数据开发平台建设。Apache Gravitino PPMC。研究方向:OLAP 引擎、统一元数据、数据平台。
在 AGI 时代,为构建一个高质量的 LLM 应用,对数据提出了新的需求。无论是数据的覆盖范围,还是数据的准确性,都对 LLM 应用的质量起到了决定性的作用。更为重要的是,LLM 使得非结构化数据的聚集以及处理变得非常关键:如何能获取并管理海量的结构化尤其是非结构化数据,如何全链路支持 LLM 的训练、调优、推理所需要的数据,解决大模型的“幻觉”,构建企业级的 RAG 应用,统一数据目录成为每个企业亟待解决的问题与挑战。本次分享会为大家介绍企业在 AGI 时代所面临的最直接的数据挑战,包括:难以高效地管理、获取全域数据,缺乏统一地进行数据治理和权限控制,传统的数据湖体系和 GenAI 框架之间的鸿沟等等。为了应对这些挑战,我们研发了Apache Gravitino项目,并做了很多前沿创新,包括:统一的结构化和非结构化数据模型来统一管理异构以及跨云跨域的数据,统一权限模型来简化云上和云下数据的管理,在主流框架如 LangChain、LlamaIndex 以及 Vector Store 的基础上构建下一代企业级 Data Agent 来解决当前 RAG 方案的系统性问题等等。除了技术设计和实现的细节,本次分享也会结合这些技术在小米的大规模实践来为大家带来下一代数据目录体系的最佳实践。通过这次分享,听众对于构建下一代面向 GenAI 的统一数据平台会有更多的实践经验。
演讲提纲
1. 背景 & 挑战
2. 策略:通过前沿技术 Gravitino 来解决 GenAI 时代的统一数据管理
3. 策略:构建统一的权限模型来统一管理云上和云下数据
4. 实践:小米构建下一代面向 GenAI 的统一数据平台
5. 总结与展望
实践痛点
AI 的统一元数据基座,在实践过程中面临几个挑战:
演讲亮点
听众收益



微信咨询

电话咨询
微信联系我们

