肖红梅,毕业于北京大学,曾任职于微策略、美团、Pegasus 大数据公司,具备丰富大数据开发与调优、大数据产品分析、数据仓库/建模、项目管理及敏捷开发的经验。现担任 Comcast FreeWheel 核心业务数据 Transformer 团队负责人,主要负责基于大数据 Data Pipelines 平台的搭建、实践、优化及数据仓库的建模与核心数据发布。热爱大数据技术沉淀和分享,致力于构建让数据业务产品更易用的大数据生态圈,为业务增值。

肖红梅,毕业于北京大学,曾任职于微策略、美团、Pegasus 大数据公司,具备丰富大数据开发与调优、大数据产品分析、数据仓库/建模、项目管理及敏捷开发的经验。现担任 Comcast FreeWheel 核心业务数据 Transformer 团队负责人,主要负责基于大数据 Data Pipelines 平台的搭建、实践、优化及数据仓库的建模与核心数据发布。热爱大数据技术沉淀和分享,致力于构建让数据业务产品更易用的大数据生态圈,为业务增值。
Spark 3.0 在 2020 年 6 月官方重磅发布,并于 9 月发布稳定线上版本,这是 Spark 有史以来最大的一次 release,共包含了3400多个 patches。
团队通过高效的敏捷开发赶在2020年圣诞广告季之前在生产环境顺利发布 Spark 3.0 升级的上线,整体 Data Pipelines 性能提升高达 40%(对于大batch)的数据,AWS Cost 平均节省 25% ~ 30% 之间,大约每年至少能为公司节省百万成本。目前线上稳定运行,预期借助此次升级能够更从容为 FreeWheel 高速增长业务量和数据分析需求保驾护航。在这次 Spark 3.0 的升级中,其实并不是一个简简单单的版本更换,因为团队的 Data Pipelines 所依赖的生态圈本质上其实也发生了一个很大的变化。
演讲主要是想和大家分享一下 Spark 3.0 在 FreeWheel 大数据团队升级背后的故事和相关的实战经验,踩过的坑,以及为什么达到既能提升性能又能省钱的效果。
演讲提纲:
你将获得:



微信咨询

电话咨询
微信联系我们

