Apache Spark 3.0 新特性在FreeWheel核心业务数据团队的应用与实战

所属专题:大数据开源框架与应用

嘉宾 : 肖红梅 | FreeWheelTeam Leader

会议室 : 307

讲师介绍

专题演讲嘉宾:肖红梅

FreeWheelTeam Leader

肖红梅,毕业于北京大学,曾任职于微策略、美团、Pegasus 大数据公司,具备丰富大数据开发与调优、大数据产品分析、数据仓库/建模、项目管理及敏捷开发的经验。现担任 Comcast FreeWheel 核心业务数据 Transformer 团队负责人,主要负责基于大数据 Data Pipelines 平台的搭建、实践、优化及数据仓库的建模与核心数据发布。热爱大数据技术沉淀和分享,致力于构建让数据业务产品更易用的大数据生态圈,为业务增值。

议题介绍

演讲:Apache Spark 3.0 新特性在FreeWheel核心业务数据团队的应用与实战

Spark 3.0 在 2020 年 6 月官方重磅发布,并于 9 月发布稳定线上版本,这是 Spark 有史以来最大的一次 release,共包含了3400多个 patches。

团队通过高效的敏捷开发赶在2020年圣诞广告季之前在生产环境顺利发布 Spark 3.0 升级的上线,整体 Data Pipelines 性能提升高达 40%(对于大batch)的数据,AWS Cost 平均节省 25% ~ 30% 之间,大约每年至少能为公司节省百万成本。目前线上稳定运行,预期借助此次升级能够更从容为 FreeWheel 高速增长业务量和数据分析需求保驾护航。在这次 Spark 3.0 的升级中,其实并不是一个简简单单的版本更换,因为团队的 Data Pipelines 所依赖的生态圈本质上其实也发生了一个很大的变化。

演讲主要是想和大家分享一下 Spark 3.0 在 FreeWheel 大数据团队升级背后的故事和相关的实战经验,踩过的坑,以及为什么达到既能提升性能又能省钱的效果。

演讲提纲:

  1. Spark 3.0 关键新特性回顾
    • AQE
    • DPP
    • UDAF
    • 文档与监控
    • 生态圈建设
  2. 团队架构与 Pipelines 简介
  3. 实践成果
    • 性能提升明显(达40%)
    • 集群内存使用降低(达30%)
    • AWS Cost 降低(30%)
    • 其他
  4. 我们做了什么?遇到了哪些坑?
    • Spark 升级到最新稳定版3.0.1遇到的问题和挑战
    • 依赖 Hadoop 3.2.1大版本升级
    • EMR 升级到大版本6.2.0遇到的问题和挑战
    • 其他
  5. 为什么既能提升性能又能省钱?
  6. 未来展望

你将获得:

  1. 回顾 Spark 3.0 关键新特性
  2. 了解 Spark 3.0 的实践成果及获得收益的原因
  3. 了解升级中可能面临的问题和解决的办法,可以在 Spark 升级的道路上走的更顺畅一些

交通指南

北京国际会议中心

Beijing International Convention Center
地址:北京市朝阳区北辰东路7号
  • 微信咨询

  • 电话咨询

    联系电话:+86 17310043226

微信联系我们

小姐姐