Apache 软件基金会聚焦了一大批的大数据领域的项目,除了大家耳熟能详的项目 ... 展开 >




姜宁,华为开源能力中心技术专家,前红帽软件首席软件工程师,有十五年企业级开源中间件开发经验,有丰富的 Java 开发和使用经验,函数式编程爱好者。从 2006 年开始一直从事 Apache 开源中间件项目的开发工作,先后参与 Apache CXF、 Apache Camel,以及 Apache ServiceMix 的开发。对微服务架构、WebServices、Enterprise Integration Pattern、SOA、OSGi 有比较深入的研究。
Apache 软件基金会聚焦了一大批的大数据领域的项目,除了大家耳熟能详的项目 Hadoop、Spark、还有近几年新兴的 CarbonData、Flink、IoTDB、Pulsar 。 这些项目有一个共同的特点,他们都是来自于 Apache 软件基金会的顶级项目。 本专题将聚焦这些新兴的开源框架,邀请这些开源框架背后的工程师来给大家分享,这些框架的起源以及项目的典型案例。
近年来,有赞的业务飞速发展,业务逐渐多元化,并且在垂直领域逐渐深入。越来越多的商家希望我们能够帮助企业解决经营效率和增长的问题,有赞的 OLAP 也面临了更多瓶颈和挑战。
本次分享主要介绍了 Apache Kylin4.0 给有赞的 OLAP 基础服务带来更多能力和性能提升,以及 Kylin4.0 在有赞的主要优化,其中包括我们如何优化 SQL 执行计划,动态消除分区维度来混合使用 cuboid 为复杂查询减少数十倍的 IO 和计算量;支持更加复杂过滤条件下的分区裁剪;以及如何尽量让小查询性能接近 On HBase 等。
演讲提纲:
你将获得:
能够了解到了大数据 OLAP 领域的应用,以及 Apache Kylin 4.0 最新版本在企业生产环境的实践和优化经验。
Spark 3.0 在 2020 年 6 月官方重磅发布,并于 9 月发布稳定线上版本,这是 Spark 有史以来最大的一次 release,共包含了3400多个 patches。
团队通过高效的敏捷开发赶在2020年圣诞广告季之前在生产环境顺利发布 Spark 3.0 升级的上线,整体 Data Pipelines 性能提升高达 40%(对于大batch)的数据,AWS Cost 平均节省 25% ~ 30% 之间,大约每年至少能为公司节省百万成本。目前线上稳定运行,预期借助此次升级能够更从容为 FreeWheel 高速增长业务量和数据分析需求保驾护航。在这次 Spark 3.0 的升级中,其实并不是一个简简单单的版本更换,因为团队的 Data Pipelines 所依赖的生态圈本质上其实也发生了一个很大的变化。
演讲主要是想和大家分享一下 Spark 3.0 在 FreeWheel 大数据团队升级背后的故事和相关的实战经验,踩过的坑,以及为什么达到既能提升性能又能省钱的效果。
演讲提纲:
你将获得:
Apache IoTDB 是专为管理工业物联网时序数据的 DBMS 系统,为适配工业时序数据的读写特点,IoTDB 在数据模式(Schema)、数据读写的方式上与传统关系数据库、时序数据库有所不同。本次分享以某工程装备管理企业的实际需求为例,介绍了基于 IoTDB 的数据采集、存储、查询、分析、可视化的完整解决方案构建,重点介绍在实际应用场景中 IoTDB 的最优数据 Schema 定义(避免进入建模误区)和数据读写方法,以及在性能优化方面展开讨论。
演讲提纲:
你将获得:
当新生事物出现时,总有两种角度去观察它,要么把它看小,要么把它放大。对于 Apache Pulsar,把它看小的角度通常是“Apache Pulsar 只是一个新的消息队列而已“,或者“Apache Pulsar 只是一个新的数据管道而已”,“队列系统早就有了,只是 Apache Pulsar 更具扩展性也能解决某些场景问题而已,基本没啥本质区别”。很明显,上述种种认识都不对。Apache Pulsar 作为 Apache 软件基金会顶级项目,是下一代云原生分布式消息流平台,集消息、存储、轻量化函数式计算为一体,采用计算与存储分离架构设计,目前项目和社区正在快速发展,已被国内外众多知名互联网企业和行业公司采用。
本次演讲,翟佳将分享 Apache Pulsar 社区目前应用及最新进展,并探讨云原生时代在消息、流、数据管理和技术基础设施层面的技术演进。
你将获得:



微信咨询

电话咨询
微信联系我们

