Gazelle 引擎 - 本地化 Spark SQL 引擎获取性能上质的提升

所属专题:大数据分析技术选型

嘉宾 : 杨宾伟 | Intel高级技术专家

会议室 : 宴会厅2

讲师介绍

专题演讲嘉宾:杨宾伟

Intel高级技术专家

英特尔大数据计算团队高级技术专家。2006 年毕业后加入英特尔,之后一直从事性能分析,优化相关工作。转战数据库,浏览器,CPU 设计等部门。目前在大数据计算组带领 SparkSQL引擎优化团队。

议题介绍

演讲:Gazelle 引擎 - 本地化 Spark SQL 引擎获取性能上质的提升

作为应用最为广泛的大数据计算平台,Spark 的成功有目共睹。然而当前的 Spark SQL 引擎采用内部行格式作为基本数据格式并基于 JVM 实现,虽然一直以来都在优化例如采用 whole stage code gen 并获取了性能的提升。然而在当前设计中很难使用 AVX512 等高级 SIMD 指令,从而导致严重的优化瓶颈,是对新一代 CPU 资源的极大浪费。

为解决优化瓶颈,我们开发了 Gazelle 引擎。作为 Spark 的 plugin,Gazelle 采用 Apache Arrow 作为基本数据格式,在 Arrow Computer kernel 的基础上使用 C++ 实现 agregation、sort、join 等各个 SQL 操作单元并采用 AVX512 等指令进行优化,从而实现 SQL 引擎的本地化,使得性能得到可持续的质的提升。

演讲提纲:

1. 设计目标

  • Spark SQL engine 当前问题
  • Apache Arrow 简介

2. 引擎简介

  • Gazelle 模块

3. 执行过程

  • Gazelle 与 Spark 的集成
  • Gazelle 数据格式
  • 本地化的方式和过程

4. 性能分析

  • 性能比较
  • 性能指标分析
  • 执行时间分解

你将获得:

  • 了解当前 Spark SQL 引擎的局限
  • 了解 Gazelle 引擎的整体设计
  • 了解 SQL 引擎本地化的性能优势
  • 了解 SQL 引擎本地化过程中遇到的技术难点
  • 了解采用 SIMD 指令优化操作单元的性能提升

交通指南

上海宝华万豪酒店

Shanghai Marriott Hotel Parkview
地址:上海市静安区广中西路 333 号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

小姐姐 小倩