小米数据湖负责人,在小米参与流式计算 Flink,数据湖 Iceberg,Paimon,元数据湖 Gravitino 等开发工作,同时负责小米大模型数据预处理相关工作。
本次演讲主要小米数据湖架构 Iceberg 及 Paimon 演进的历程,并介绍小米使用 Apache Gravitino 统一元数据,以及使用 Fileset 进行非表格数据管理和使用上的经验。同时将分享在实际业务中如何有效的使用 Iceberg,Paimon 和 Fileset 来实现的数据在 Data 和 AI 场景的快速流转。
演讲提纲
1. 小米数据湖架构
2. 从 Iceberg 到 Paimon
3. AI 场景下非表格数据的管理和使用
4. 统一元数据
5. 实际业务案例
6. 未来规划
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
微信联系我们

