下一代大数据系统架构主要关注大数据计算引擎与架构的最新实践。
... 展开 >



下一代大数据系统架构主要关注大数据计算引擎与架构的最新实践。
随着数据规模的快速增长,基于内存的向量搜索面临着海量且非常昂贵的内存需求,因此,人们对小内存-大硬盘混合型向量近似最近邻搜索的需求也越来越迫切。同时,传统的分布式搜索系统需要将每一个查询都分发给每台机器进行本地查询,这会导致查询延迟和资源开销会随着机器数量的增多而变大,系统可扩展性变差。因此,我们提出了一种非常简单且高效的基于倒排索引思想的内存-硬盘混合型索引和搜索方案SPANN,有效地解决了倒排索引方法中的三个会导致高延迟或者低召回的难题。实验结果显示,SPANN在多个上亿量级数据集上都能取得两倍多的加速达到90%召回率,其查询延迟能够有效地控制在一毫秒左右。同时,SPANN的设计能够有效地被扩展到分布式搜索中限制每个查询的资源开销和延迟大小,从而实现高可扩展性。目前SPANN已经被部署在了微软必应搜索中支持千亿量级的高性能向量近似最近邻搜索。
演讲提纲:
1. 当前企业数字化转型的迫切需求 vs 碎片化数据世界的挑战
2. 介绍 Alluxio 数据编排项目,回顾 Alluxio 项目历史
3. Alluxio 数据 API
4. Alluxio 的 Cache 功能
5. Alluxio 数据分层功能
6. Alluxio 的案例分享
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

