大数据分析技术选型

会议室:宴会厅2
出品人:郭东东

当下数据规模正在以惊人的速度增长,而这些数据类型混杂,给大数据分析工作带来了不小... 展开 >

专题出品人:郭东东

字节跳动数据平台数据应用研发负责人

目前就职于字节跳动数据平台,负责数据应用相关产品的研发,具体包括 AB 实验平台、行为分析系统、智能 BI 洞察系统相关产品等,支撑内部的抖音、今日头条等核心业务线。曾经任职于奇虎360,负责大数据平台相关建设,有 10 年的大数据平台以及应用架构经验,对 OLAP、大数据实时&离线处理技术有比较深入的了解,熟悉 ClickHouse、Spark、Presto 等主流的大数据处理技术。

地点:宴会厅2

专题:大数据分析技术选型

当下数据规模正在以惊人的速度增长,而这些数据类型混杂,给大数据分析工作带来了不小的挑战。本专题将邀请多位大数据分析技术的一线开发者前来分享,聚焦希望能给正在纠结选型的团队一些借鉴和思考。我们关注计算引擎、应用层能力以及一些新技术的赋能,包括 ClickHouse、Hologres、增强分析、数据可视化分析、湖仓一体分析等等。

by 陈星

字节跳动
分析型数据库负责人

演讲提纲:

1. 字节跳动大数据分析的挑战和技术选型思路
2. 从ClickHoue到ByteHouse

  • ClickHouse 介绍和优劣势分析
  • 字节自研版本 ByteHouse 优势介绍

3. ByteHouse在字节大数据分析场景的探索

  • 实时分析
  • 用户行为分析
  • 用户画像

4. ByteHouse未来技术展望

by 施畅(三策)

阿里巴巴
高级技术专家

Hologres 是基于服务分析一体化理念(HSAP)设计的一站式实时数仓。和其他大数据 OLAP 方案相比,同时支持高质量的在线服务(Serving)以及高 QPS 实时写入,是 Hologres 的核心竞争力之一。在线服务场景可用性是重中之重,如何保证高 QPS 实时写入的同时支持高质量的分析服务是一个技术难题。Hologres 提供了多个层次的高可用/隔离方案,用户可以在 SLA 和成本之间做权衡,满足了不同场景的需求。Hologres 从诞生至今,支撑了集团内多个核心业务(DT、CCO、搜索、钉钉)的大促需求,本文会详细介绍 Hologres 的高可用/隔离架构,以及集团内各个业务基于 Hologres 的高可用实践。

演讲提纲:

1. Hologres 背景简介

2. Hologres 高可用架构设计

  • 计算存储分离
  • 隔离层级
  • Replica(ShareNothing/ShareStorage)
  • 健康检测(HM/JM)
  • 流量控制

3. Hologres 高可用实践

  • 计算存储双链路 + 读写实例隔离(DT)
  • 计算存储双链路(钉钉)
  • 计算双链路 + 读写实例分离(CCO)
  • 基于资源组的读写分离
  • 基于机器打标的实例隔离

4. 未来规划

by 陈畅

Kyligence
资深架构师兼首席性能专家
近⽇,Apache Kylin 社区向⽤户发布了Kylin 4 全⾯可⽤的重⼤更新。Kylin 4 继续以提供统⼀、⾼性能、低云成本的开源OLAP 平台为使命。Kylin 4 升级了其架构,使其易于在云中部署和扩展。新版本具有三个主要更新和⽆数其他改进。⾸先,Kylin 4 ⽤ Apache Parquet 替换了之前的 HBase 存储引擎,使得计算和存储解耦成为可能,以实现⽆限的独⽴可扩展性。其次,Kylin 4 统⼀了计算引擎并消除了之前对 Yarn 和 HDFS 的依赖。这使得资源分配更加灵活,从⽽显着降低了云资源的总使⽤量和相关成本。第三,通过引⼊全新的计算和完全分布式查询引擎,与以前的版本相⽐,cubing 持续时间和查询延迟将更加⾼效。本次演进,我们将深⼊探讨这些新创新及其启⽤的新功能的详细信息。

by 王珂

字节跳动
A/B 测试平台技术负责人

字节跳动 A/B 测试平台作为公司的基础服务平台之一,为头条、抖音、西瓜、火山等公司上百个业务线提供 A/B 实验能力,覆盖了推荐、广告、搜索、电商、直播、用户增长等业务场景,为 App端、服务端、Web 端、PC 端提供了标准解决方案。本次分享主要介绍字节跳动 A/B 测试平台的演进历史,遇到的挑战,以及在演进过程中的实践经验和对未来的展望。

演讲提纲:

1. 字节跳动 A/B 测试平台发展历程
2. 字节跳动 A/B 测试应用场景
3. 在字节跳动发展中的经验沉淀
4. 实际案例解析
5. 总结与展望

by 杨宾伟

Intel
高级技术专家

作为应用最为广泛的大数据计算平台,Spark 的成功有目共睹。然而当前的 Spark SQL 引擎采用内部行格式作为基本数据格式并基于 JVM 实现,虽然一直以来都在优化例如采用 whole stage code gen 并获取了性能的提升。然而在当前设计中很难使用 AVX512 等高级 SIMD 指令,从而导致严重的优化瓶颈,是对新一代 CPU 资源的极大浪费。

为解决优化瓶颈,我们开发了 Gazelle 引擎。作为 Spark 的 plugin,Gazelle 采用 Apache Arrow 作为基本数据格式,在 Arrow Computer kernel 的基础上使用 C++ 实现 agregation、sort、join 等各个 SQL 操作单元并采用 AVX512 等指令进行优化,从而实现 SQL 引擎的本地化,使得性能得到可持续的质的提升。

演讲提纲:

1. 设计目标

  • Spark SQL engine 当前问题
  • Apache Arrow 简介

2. 引擎简介

  • Gazelle 模块

3. 执行过程

  • Gazelle 与 Spark 的集成
  • Gazelle 数据格式
  • 本地化的方式和过程

4. 性能分析

  • 性能比较
  • 性能指标分析
  • 执行时间分解

你将获得:

  • 了解当前 Spark SQL 引擎的局限
  • 了解 Gazelle 引擎的整体设计
  • 了解 SQL 引擎本地化的性能优势
  • 了解 SQL 引擎本地化过程中遇到的技术难点
  • 了解采用 SIMD 指令优化操作单元的性能提升

交通指南

上海宝华万豪酒店

Shanghai Marriott Hotel Parkview
地址:上海市静安区广中西路 333 号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

小姐姐 小倩