李经纶,Apache Hadoop Committer,火山引擎 EMR 技术专家。长期从事大数据领域存算引擎研发工作。在 Hadoop 的存算一体、存算分离架构、大规模 Hadoop 集群治理等方向上有深入积累。

李经纶,Apache Hadoop Committer,火山引擎 EMR 技术专家。长期从事大数据领域存算引擎研发工作。在 Hadoop 的存算一体、存算分离架构、大规模 Hadoop 集群治理等方向上有深入积累。
在过去的几年里,数据湖方案从快速兴起,到被众多客户广为接受。在当下的时间点,数据湖方案已经相对足够成熟,能够应对客户的海量大数据分析场景。随着近期的大模型潮流兴起,又对数据湖方案提出了更大的挑战。例如:传统 HMS 上云的种种问题、Catalog 在大数据和 AI 上的割裂、AI 对 IO 访问模式的新需求、云上构建传统数仓的困难以及生态的问题等等。在本次 Talk 中,我会分享上述挑战,并说明我们的解决之道。
演讲提纲
1. LLM 场景下对传统数据湖方案提出的挑战
2. 火山引擎的解决之道及最佳实践
3. 经验总结和未来展望
实践痛点
演讲亮点
大模型对数据湖提出的新挑战,包括半结构化、非结构化 、AI 模型数据的管理,以及 IO 访问的针对性优化
听众收益



微信咨询

电话咨询
微信联系我们

