毕业于新加坡国立大学,曾就职于 PayPal AI Infra,从事大数据数据湖、ML 特征工程等相关工作 8 年,取得过十余份该领域的专利。目前是字节跳动基础架构 Iceberg 数据湖、Feature Store 样本存储的主要负责人。

毕业于新加坡国立大学,曾就职于 PayPal AI Infra,从事大数据数据湖、ML 特征工程等相关工作 8 年,取得过十余份该领域的专利。目前是字节跳动基础架构 Iceberg 数据湖、Feature Store 样本存储的主要负责人。
深度学习的模型规模越来越庞大,其训练数据量级也成倍增长,这对海量训练数据的存储方案提出了更高的要求:怎么样更高性能地读取训练样本、不让数据读取成为模型训练瓶颈,怎么样更高效的支持特征工程、能够更便捷地增删和回填特征。传统的数仓方案和直接使用 Hadoop 或对象存储来存放样本都不能很理想的满足以上业务需求。 本次演讲将介绍字节跳动如何通过 Iceberg 数据湖支持 EB 级机器学习样本存储,实现高性能特征读取和高效特征调研、特征工程加速模型迭代。
演讲提纲:
1. 背景与趋势
2. 字节跳动自研强化版 Iceberg
3. 机器学习样本存储实践
4. 总结与展望
你将获得:



微信咨询

电话咨询
微信联系我们

