大数据开源框架与应用

会议室:307
出品人:姜宁

Apache 软件基金会聚焦了一大批的大数据领域的项目,除了大家耳熟能详的项目 ... 展开 >

专题出品人:姜宁

华为技术专家

姜宁,华为开源能力中心技术专家,前红帽软件首席软件工程师,有十五年企业级开源中间件开发经验,有丰富的 Java 开发和使用经验,函数式编程爱好者。从 2006 年开始一直从事 Apache 开源中间件项目的开发工作,先后参与 Apache CXF、 Apache Camel,以及 Apache ServiceMix 的开发。对微服务架构、WebServices、Enterprise Integration Pattern、SOA、OSGi 有比较深入的研究。

地点:307

专题:大数据开源框架与应用

Apache 软件基金会聚焦了一大批的大数据领域的项目,除了大家耳熟能详的项目 Hadoop、Spark、还有近几年新兴的 CarbonData、Flink、IoTDB、Pulsar 。 这些项目有一个共同的特点,他们都是来自于 Apache 软件基金会的顶级项目。 本专题将聚焦这些新兴的开源框架,邀请这些开源框架背后的工程师来给大家分享,这些框架的起源以及项目的典型案例。

by 郑生俊

有赞
数据中台/数据基础平台负责人

近年来,有赞的业务飞速发展,业务逐渐多元化,并且在垂直领域逐渐深入。越来越多的商家希望我们能够帮助企业解决经营效率和增长的问题,有赞的 OLAP 也面临了更多瓶颈和挑战。

本次分享主要介绍了 Apache Kylin4.0 给有赞的 OLAP 基础服务带来更多能力和性能提升,以及 Kylin4.0 在有赞的主要优化,其中包括我们如何优化 SQL 执行计划,动态消除分区维度来混合使用 cuboid 为复杂查询减少数十倍的 IO 和计算量;支持更加复杂过滤条件下的分区裁剪;以及如何尽量让小查询性能接近 On HBase 等。

演讲提纲:

  1. 为什么选择 Kylin V4
    • 有赞 OLAP 介绍
    • OLAP 在有赞的挑战和困境
    • Kylin V4的优势
  2. Kylin V4 原理介绍
    • 存储和查询介绍
    • Cube 构建介绍
  3. Apache Kylin4 在有赞的性能优化与实践
    • 查询性能优化
    • 构建性能优化
  4. 未来计划

你将获得:

能够了解到了大数据 OLAP 领域的应用,以及 Apache Kylin 4.0 最新版本在企业生产环境的实践和优化经验。

by 肖红梅

FreeWheel
Team Leader

Spark 3.0 在 2020 年 6 月官方重磅发布,并于 9 月发布稳定线上版本,这是 Spark 有史以来最大的一次 release,共包含了3400多个 patches。

团队通过高效的敏捷开发赶在2020年圣诞广告季之前在生产环境顺利发布 Spark 3.0 升级的上线,整体 Data Pipelines 性能提升高达 40%(对于大batch)的数据,AWS Cost 平均节省 25% ~ 30% 之间,大约每年至少能为公司节省百万成本。目前线上稳定运行,预期借助此次升级能够更从容为 FreeWheel 高速增长业务量和数据分析需求保驾护航。在这次 Spark 3.0 的升级中,其实并不是一个简简单单的版本更换,因为团队的 Data Pipelines 所依赖的生态圈本质上其实也发生了一个很大的变化。

演讲主要是想和大家分享一下 Spark 3.0 在 FreeWheel 大数据团队升级背后的故事和相关的实战经验,踩过的坑,以及为什么达到既能提升性能又能省钱的效果。

演讲提纲:

  1. Spark 3.0 关键新特性回顾
    • AQE
    • DPP
    • UDAF
    • 文档与监控
    • 生态圈建设
  2. 团队架构与 Pipelines 简介
  3. 实践成果
    • 性能提升明显(达40%)
    • 集群内存使用降低(达30%)
    • AWS Cost 降低(30%)
    • 其他
  4. 我们做了什么?遇到了哪些坑?
    • Spark 升级到最新稳定版3.0.1遇到的问题和挑战
    • 依赖 Hadoop 3.2.1大版本升级
    • EMR 升级到大版本6.2.0遇到的问题和挑战
    • 其他
  5. 为什么既能提升性能又能省钱?
  6. 未来展望

你将获得:

  1. 回顾 Spark 3.0 关键新特性
  2. 了解 Spark 3.0 的实践成果及获得收益的原因
  3. 了解升级中可能面临的问题和解决的办法,可以在 Spark 升级的道路上走的更顺畅一些

by 黄向东

清华大学
软件学院/助理研究员

Apache IoTDB 是专为管理工业物联网时序数据的 DBMS 系统,为适配工业时序数据的读写特点,IoTDB 在数据模式(Schema)、数据读写的方式上与传统关系数据库、时序数据库有所不同。本次分享以某工程装备管理企业的实际需求为例,介绍了基于 IoTDB 的数据采集、存储、查询、分析、可视化的完整解决方案构建,重点介绍在实际应用场景中 IoTDB 的最优数据 Schema 定义(避免进入建模误区)和数据读写方法,以及在性能优化方面展开讨论。

演讲提纲:

  1. Apache IoTDB 简单介绍
  2. 以某企业实际需求为例,总结时序数据的读写特点
  3. 以某企业实际需求为例,介绍该 IoTDB 的数据建模方式(Schema)定义
  4. 介绍 IoTDB 不同写接口的性能差异及其原因
  5. 介绍 IoTDB 的查询接口及异常性能的排查方法
  6. 介绍基于 IoTDB 的完整解决方案

你将获得:

  1. 了解工业物联网时序数据与 DevOps 中时序数据的区别,有助于根据实际负载合理选择解决方案
  2. 了解 IoTDB 的数据模式建模的误区及常见性能优化方法
  3. 了解针对时序数据的完整解决方案

by 翟佳

StreamNative
联合创始人

当新生事物出现时,总有两种角度去观察它,要么把它看小,要么把它放大。对于 Apache Pulsar,把它看小的角度通常是“Apache Pulsar 只是一个新的消息队列而已“,或者“Apache Pulsar 只是一个新的数据管道而已”,“队列系统早就有了,只是 Apache Pulsar 更具扩展性也能解决某些场景问题而已,基本没啥本质区别”。很明显,上述种种认识都不对。Apache Pulsar 作为 Apache 软件基金会顶级项目,是下一代云原生分布式消息流平台,集消息、存储、轻量化函数式计算为一体,采用计算与存储分离架构设计,目前项目和社区正在快速发展,已被国内外众多知名互联网企业和行业公司采用。

本次演讲,翟佳将分享 Apache Pulsar 社区目前应用及最新进展,并探讨云原生时代在消息、流、数据管理和技术基础设施层面的技术演进。

你将获得:

  1. 获取对 Apache Pulsar 基础架构和设计理念的认识;
  2. 了解当前实时数据基础设施的挑战;
  3. 介绍消息融合和批流融合的存储,带你了解云原生时代的运维;
  4. 获取 Apache Pulsar 未来展望与规划。

交通指南

北京国际会议中心

Beijing International Convention Center
地址:北京市朝阳区北辰东路7号
  • 微信咨询

  • 电话咨询

    联系电话:+86 17310043226

微信联系我们

小姐姐