下一代 Data for AI 技术架构

会议室:钻石厅A
出品人:堵俊平

LLM 的潮流方兴未艾,智能 Agent 的时代又将到来。在这一波 AI 浪潮之... 展开 >

专题出品人:堵俊平

DatastratoFounder & CEO

堵俊平,明星初创企业 Datastrato 的 Founder & CEO, 在数据与 AI 赛道耕耘十数年,曾任 LF AI & DATA 基金会董事主席,500 强企业开源战略与生态负责人,前腾讯开源联盟主席及数据平台总监,前 Hortonworks Hadoop 团队技术 Leader 等。

地点:钻石厅A

专题:下一代 Data for AI 技术架构

LLM 的潮流方兴未艾,智能 Agent 的时代又将到来。在这一波 AI 浪潮之下,数据技术作为 AI 的基石,又将产生哪些革命和颠覆性的突破?本专题将从 LLM、智能 Agent、RAG 等不同的热点领域方向,来探讨新一代 Data 技术的突破方向与思路。

本专题讨论的方向涵盖:

  1. 数据资产的统一管理、治理:如何面向大模型的需求来广泛获取数据并提升数据的质量与治理?
  2. AI 大模型类:需要哪些新的数据处理范式、数据分析趋势,比如 GPT-4o 模型多模态数据;
  3. 数据平台类:怎么做数据转型以适应大模型,新兴的向量数据库与传统的数仓、数据湖技术该如何结合以发挥各自优势?
  4. AI 和数据结合:非结构化数据分析等等。

通过本专题,参会者可以学习如何识别和管理数据资产,掌握数据治理的新方法,了解不同行业如何利用数据技术和 AI 进行创新和转型,为未来的技术革新和业务发展做好准备。

by 李经纶

火山引擎
高级技术专家

在过去的几年里,数据湖方案从快速兴起,到被众多客户广为接受。在当下的时间点,数据湖方案已经相对足够成熟,能够应对客户的海量大数据分析场景。随着近期的大模型潮流兴起,又对数据湖方案提出了更大的挑战。例如:传统 HMS 上云的种种问题、Catalog 在大数据和 AI 上的割裂、AI 对 IO 访问模式的新需求、云上构建传统数仓的困难以及生态的问题等等。在本次 Talk 中,我会分享上述挑战,并说明我们的解决之道。

演讲提纲

1. LLM 场景下对传统数据湖方案提出的挑战

  • 挑战一:结构化数据和半结构化数据对Catalog提出更高要求
    • 传统 HMS 不适合搬迁到云上
    • 大数据和 AI 的 Catalog 割裂
  • 挑战二:经典对象存储越来越难以满足 LLM 场景海量数据的访问要求
    • 大模型场景对 IO 带宽扩展性要求极高
    • GPU 资源昂贵,而远程随机 IO 延迟过高影响效率
    • AI 生态对 POSIX 语义适配度最高,但是对象存储语义和 POSIX 语义相去甚远
  • 挑战三:大数据和AI复杂的场景对通用数据湖的要求越发迫切。
    • 云上构建传统大数据数仓非常困难
    • 传统大数据数仓缺乏AI生态
    • 火山引擎的解决之道及最佳实践

2. 火山引擎的解决之道及最佳实践

  • 解法一:火山统一 Catalog 同时管理结构化、半结构化、非结构化、AI 模型数据
    • 云上服务化的多租户 Catalog
    • 统一 AI 和大数据的 Catalog设计
  • 解法二:火山存储加速层针对性优化大数据和 AI 场景的 IO 访问
    • 火山大数据加速层实现 IO 带宽扩展性
    • 本地数据缓存将随机 IO 延迟降低 2 个数据级 ( 10ms -> 0.1ms )
    • TOS fuse 客户端无缝连接 TOS 和 POSIX API
  • 解法三:基于开源数据湖格式构建通用数据湖
    • 基于 Iceberg 方案构建通用数据湖
    • Iceberg 同时桥接大数据 和 AI 生态

3. 经验总结和未来展望

实践痛点

  • 对象存储的透明加速在大数据、AI 场景下牺牲了语义层面的兼容
  • 元数据扩展性牺牲了元数据的缓存加速

演讲亮点
大模型对数据湖提出的新挑战,包括半结构化、非结构化 、AI 模型数据的管理,以及 IO 访问的针对性优化

听众收益

  • 了解在数据场景下很成熟的基础设施体系在 AI 场景下有何本质挑战
  • LLM场景在 Catalog、存储、计算方面到底有何实质性的更高要求
  • 火山引擎是如何从现有大数据体系演进到适用 AI 场景的大数据体系

by 邵赛赛

Datastrato
联合创始人 & CTO

by 周康

小米
数据开发平台负责人

在 AGI 时代,为构建一个高质量的 LLM 应用,对数据提出了新的需求。无论是数据的覆盖范围,还是数据的准确性,都对 LLM 应用的质量起到了决定性的作用。更为重要的是,LLM 使得非结构化数据的聚集以及处理变得非常关键:如何能获取并管理海量的结构化尤其是非结构化数据,如何全链路支持 LLM 的训练、调优、推理所需要的数据,解决大模型的“幻觉”,构建企业级的 RAG 应用,统一数据目录成为每个企业亟待解决的问题与挑战。本次分享会为大家介绍企业在 AGI 时代所面临的最直接的数据挑战,包括:难以高效地管理、获取全域数据,缺乏统一地进行数据治理和权限控制,传统的数据湖体系和 GenAI 框架之间的鸿沟等等。为了应对这些挑战,我们研发了Apache Gravitino项目,并做了很多前沿创新,包括:统一的结构化和非结构化数据模型来统一管理异构以及跨云跨域的数据,统一权限模型来简化云上和云下数据的管理,在主流框架如 LangChain、LlamaIndex 以及 Vector Store 的基础上构建下一代企业级 Data Agent 来解决当前 RAG 方案的系统性问题等等。除了技术设计和实现的细节,本次分享也会结合这些技术在小米的大规模实践来为大家带来下一代数据目录体系的最佳实践。通过这次分享,听众对于构建下一代面向 GenAI 的统一数据平台会有更多的实践经验。

演讲提纲

1. 背景 & 挑战

  • 生成式AI时代的数据需求与上一代数据平台的 GAP 分析
  • 现有技术在解决这些问题上所面临的挑战

2. 策略:通过前沿技术 Gravitino 来解决 GenAI 时代的统一数据管理

  • 抽象与实现统一的数据模型,来涵盖结构化和非结构化数据
  • 实现统一的异构、跨域、跨云的数据视图

3. 策略:构建统一的权限模型来统一管理云上和云下数据

  • 构建一个高效且通用的 Data Agent,来支持基于文档数据库与海量数据湖的混合语义检索

4. 实践:小米构建下一代面向 GenAI 的统一数据平台

  • 从业务视角看,为什么小米需要构建下一代的统一数据与 AI 资产管理平台
  • 在技术选型上,小米面临哪些选择以及最终选择该前沿技术的原则和逻辑
  • 在实践过程中,小米团队遇到的技术挑战,以及如何创造性的解决这些问题的

5. 总结与展望

实践痛点

AI 的统一元数据基座,在实践过程中面临几个挑战:

  • 已落地的传统数据中台与中心化数仓不能满足生成式 AI 的需求
  • LLM 所需要的数据类型比传统的 BI 更多,传统的结构化数据 ETL 和中心化管理已无法满足 LLM 训练、推理的数据需求
  • 企业在构建统一数据管理平台时,面对多种异构数据,如何设计统一的模型和访问模式具有很高的挑战
  • 更为挑战的是构建统一的权限治理模型并适配各数据源,做到统一的权限管理

演讲亮点

  • 面向生成式 AI 应用来构建新型的元数据基座,为各企业和开发者提供一个 Data for AI 的最佳实践
  • 在 AGI 场景如何高效和统一地管理数据提供标准化的参考技术案例

听众收益

  • 了解当前生成式时代传统的数据架构的痛点
  • Gravitino 的设计架构是如何解决这些痛点问题的
  • 小米如何使用 Gravitino 统一管理 AI 数据,以及在落地过程中的挑战和解决方案

by 刘迟

PayPal
资深研发工程师

人工智能是一项变革性技术,PayPal 开发了许多数据系统和AI工具来来解决各种业务的数据需求,包括欺诈检测、提高运营效率、为客户提供个性化服务和优惠、履行监管义务等等。几年前,当PayPal 开始将大数据和 AI/ML 扩展到所有核心业务领域时,越来越明显的发现,拥有一组定制数据系统和 AI 工具(通常在自己的数据孤岛中构建和运行)无法满足整个企业大规模采用大数据和 AI/ML 数据科学的需求。

为了解决上述问题,PayPal 设计并实现了一个统一的端到端的 AI/ML 数据科学平台,目标用户涵盖了公司内部不同业务部门(风控,合规、客户服务等),每天有成千上万的 Data Scientist 和Data Analyst 使用其来开发 Data Science和Machine Learning 解决方案。在生产中,数千个ML模型每天在本地和云端处理数百亿个实时和批量数据推理请求,从而满足整个 PayPal 公司的广泛业务需求。

本次演讲将重点分享如何实现企业级 AI for Data 平台的统一扩展与优化,以及 LLMOps 在 GenAI 应用中的实践经验。

演讲提纲

1. 传统的 AI for Data 平台面临的问题与挑战

  • 业务需求复杂,定制度高,存在数据孤岛
  • AI 领域技术日新月异,平台缺乏扩展性

2. 构建企业级 AI for Data 平台的指导原则与最佳实践

  • Best-of-breed 架构,注重抽象与可扩展性
  • 无缝集成企业生态系统,实现高效协作
  • Self-service with Data Governance
  • 可解释性 AI 和 Data Drift Detection
  • Multi-tenancy 多租户架构实现
  • 多云和混合云的支持

3. 从 MLOps 到 LLMOps,面向下一代 GenAI 的支持

  • MLOps 与 LLMOps 的差异与挑战
  • 构建支持 LLMOps 的基础架构
  • PayPal 在 LLMOps 落地中的实践案例,快速扩展 GenAI 应用

4. GenAI for Data 架构详解与案例分析

  • LLM 推理优化与模型压缩
  • 构建 RAG 和 Multi-Agent 的低代码框架
  • LLM 语义缓存
  • LLM 的模型评估与幻觉检测
  • PayPal 实际案例分析

5. 总结与展望

  • 构建下一代 AI for Data 平台的关键经验
  • 未来的技术趋势展望:LLMOps 与 GenAI 的进一步融合

实践痛点

  • 数据孤岛与个性化定制需求:如何打破部门间数据孤立的问题,并应对不同业务部门对定制化需求的高要求
  • AI 不可解释性与数据治理:在构建 Responsible AI 和数据治理框架时,如何解决 AI 模型的不可解释性和偏见控制问题
  • 平台扩展与技术飞跃:AI 行业发展迅速,如何确保AI平台的持续可扩展性和技术更新迭代,与最新技术保持同步
  • 快速扩展 MLOps 到 LLMOps:如何有效整合 LLM,降低生成式 AI 的部署成本,并最大限度减少团队间重复劳动

演讲亮点

  • 企业级 AI 平台设计指导原则:PayPal 从实践中总结出一套适用于复杂企业环境的 AI 平台建设指导原则,并成功应用于跨业务场景
  • Responsible AI 与 Data Governance 经验:PayPal 通过 Explainable AI 和 Data Governance Process 最大程度减少 AI 偏见,确保模型的公平性和合规性
  • 平台可扩展性与未来性:通过 Best-of-breed 架构设计,确保平台具备高扩展性,能够应对行业快速变化,支持新兴技术的集成
  • 从 MLOps 到 LLMOps,生成式 AI(GenAI) 平台构建经验:PayPal 基于已有基础设施迅速扩展支持生成式 AI,大规模提升了平台对 LLM 推理与训练的支持能力

听众收益

  • 了解构建企业级 AI for Data 平台的指导原则与最佳实践
  • 了解如何实现 Responsible AI 和 Data Security
  • 了解如何确保构建的 AI for Data 平台能够与行业保持同步
  • 了解如何快速的扩展 MLOps 到 LLMOps,集成 GenAI 技术到已有的平台
  • 了解应对数千模型、数百亿推理请求的优化方法,提升平台性能与扩展性

by 苏锐

JuiceFS
合伙人

AI 时代来了,无论你在打造基础模型,领域模型,还是要构建 AI 应用,利用 AI 技术优化现有业务。无一例外的是,越来越多的数据都是我们的核心资产,这是存储系统的挑战,也是用户做技术选型的难题。存储系统的选择不仅是选择容量、性能和成本,通用硬件兼容性、弹性、性能影响因素、性能扩展方式、客户端协议等诸多因素是实际影响业务体验的。

JuiceFS 是一款为大规模数据高性能负载设计的分布式文件系统,从 2019 年开始支持 AI 和机器学习领域,包括自动驾驶、量化金融、还有近两年最热门的生成式 AI 和大语言模型。

在为数十家 AI 企业提供服务后,希望在这次演讲中分享一下我收获的经验和思考。

演讲提纲

1. 用户视角下,存储系统选型和维护的挑战是什么?

  • 困境:难以预测未来的需求,容量、性能甚至功能都缺少抉择的依据,这与买多少张卡一样难。因为 AI 行业的发展太快了
  • 有一些描述需要更精确:大量、海量、小文件、大文件、高性能、大规模、弹性、高可用等等
  • AI 业务对存储系统的要求有哪些
  • 如何测试存储系统?fio, vdbench, 或者什么
  • 结论:计算与存储都在朝大规模分布式系统发展,一切的选择应以此为准

2. 存储系统选型中经常面临的选择

  • 集中式架构与分布式架构的比较,差异分析
  • 关注数据访问 API 的兼容性,小差异会影响你的代码能否运行
  • 用户态与内核态客户端的比较与取舍
  • AI 业务必须用 IB 网络和 RDMA 么?性能要与规模、易维护性等多方面因素同时考虑
  • 业务抱怨不够快,如何判断是不是存储的问题?论系统观测能力的重要性

3. 成本 v.s. 性能的取舍与平衡要从架构设计开始

4. 一个生成式 AI 领域的案例分享

演讲亮点

JuiceFS 是为云环境设计的整体技术架构,应该是文件存储领域的首创(2017 年)。也创新性的在架构设计上讲存储系统的容量与性能解耦,这样的设计为系统容量规划,性价比两个方面为用户带来明显的收益。

实践痛点
JuiceFS 为海量数据高吞吐业务场景设计和优化,对于少量数据和需要低时延的业务场景,JuiceFS 并不适用。

听众收益

存储系统是一个看似普通常见,但在不同业务中又是一个复杂的话题。架构师做选型决策时往往处于业务初期,并不能预测后面的变化,而存储系统在业务架构中是最难替换和迭代的。本次演讲结合目前 AI 领域的发展特点,和分享人过去 5 年服务不同领域 AI 客户的经验,让听众在分享中:

  • 了解 AI 业务中面对的数据特征以及对应的存储系统挑战和需求
  • 从用户视角分析不同存储系统架构和特性带给用户的优缺点

架构设计没有银弹,都是取舍。灵活简单算是一剂解药。

by 张粲宇

Zilliz
Senior Product Manager

自 LLM 问世以来,向量数据库一直扮演着 Infra for AI 的领跑者,在这个领域我们见到了蓬勃发展的应用场景和案例,向量检索也从最初的一枝独秀到现在的百花齐放。随着 RAG 和多模态的普及,用户对检索器(向量数据库或其他系统)的检索能力提出了更高需求,我们从应用场景和技术落地看到了对各种新技术的需求和潜力,我们将从底层技术实现到使用场景来全面的分享这些重要能力,并且分享我们从实践中应证的它们价值。

本次分享也将从我们自己的 RAG 场景(milvus 知识库)出发,分享我们在 RAG 方面看到的挑战,以及我们通过采用混合检索技术和其他技巧,最终把准确率提升到 90% 以上的经验分享,此外会将分享我们在该项目落地中所收获的经验并探讨未来 RAG 与向量检索的方向。

演讲提纲

1. RAG 场景下的数据检索问题及其挑战

  • AI 时代下的检索趋势
  • 介绍 RAG 应用落地遇到的主要挑战:检索质量、成本和安全问题

2.  Milvus 的应对之道

  • 提升准度问题:元数据过滤和混合检索技术及其优化,优化 RAG 的检索质量
  • 解决成本问题:冷热分层存储和索引等优化,如:量化和磁盘索引、大规模数据检索的降本等
  • 优化安全问题:多租以及细粒度权限管控技术,管理数据的权限和隐私

3. Milvus Ask AI:准确率提升至 90% 的企业 RAG 服务实践

  • 系统的设计, demo 以及实际效果与数据指标
  • 线上运行后遇见的典型问题及解决方案:版本问题、幻觉问题、多信息源的信息综合

4. 向量检索与 RAG 的未来发展

  •  分享最新的模型进展
  •  多模态的 RAG 检索

听众收益

1. 开拓一些新思路,用新方法如何解决传统的一些搜索问题
2.了解向量数据库以及 embedding & reranking 最前沿的技术和成果
3. 了解混合检索(倒排关键词、sparse、dense)在 RAG 和多模态检索场景里的打开方式
4. 目前领域相关的挑战,以及向量数据库的最新技术和 RAG 的未来展望

by 常亮

OPPO
分布式存储专家

随着人工智能业务的迅速发展,AI 模型训练所需的数据规模不断扩大,应用场景也逐步从云下延伸至云上。这给作为 AI 基础设施的分布式文件存储平台 CubeFS 带来了新的挑战。为应对这些挑战,CubeFS 加强了多协议接入能力,以满足多样生态数据的统一入湖和存算分离需求。同时,创新性地采用数据生命周期技术,实现智能数据分层调度,降低成本并提升效率,极大扩展了数据调度和整合的应用场景。最后,为解决云上对私有云存储的访问延时等问题,CubeFS 实现了分布式缓存和 RDMA 加速技术,构建了全链路的多维度 AI 加速解决方案。

演讲提纲

1. AI 数据存储的特点

2. AI 存储在混合云场景下面临的技术挑战

3. CubeFS 支撑 AI 存储的技术要点与实践

  • 多协议接入数据兼容技术,支持 AI 场景下多渠道将数据入湖
  • 混合云存储技术,数据智能分层,有效降低存储成本
  • RDMA 全链路加速技术的设计思考和工程实践
  • 分布式缓存技术,支持基于云端算力训练时数据的时延需求
  • AI 框架插件预加载的技术原理

4. 面向 AI 存储构建下一代混合云存储的方案

演讲亮点

  • 分布式存储的混合云技术,实现数据分层流动、云上云下调度,数据碎片整理等
  • 全栈加速能力建设实战,读写全链路 RDMA 能力改造,分布式缓存对云端 AI 算力的支持

实践痛点

老架构复杂度增加,是否重构还是在原有基础上构建的 tradeoff

听众收益

  • 了解支撑 AI 数据存储的特点和难点
  • 了解分布式存储平台的架构要点和面向 AI 等场景的解决方案
  • 分布式文件系统的演进过程与在 AI 时代的思考

by 史磊

Redis
高级架构师

过去的一年中,我们共同见证了生成式AI从起步到狂奔、再到各行各业的遍地开花。与此同时,生成式AI应用也对数据处理架构提出了新的挑战:如何在海量的私有数据中构建更加安全、更加准确、更加稳定、更高吞吐的 AI 应用,并满足用户对实时性的需求。

在本次分享中,我们将从 Redis 原厂的视角,结合 Redis 全球客户的使用案例,探讨 Redis 是如何在生成式 AI 时代应对数据处理平台的如下挑战:

  • AI 应用层:内存向量数据库及 RAG 应用设计
  • AI 存储层:内存向量数据库如何应对大数据量的查询请求
  • AI 加速层:内存数据库作为在线特征存储的使用及调优

除此之外,本次分享也会简要介绍 Redis 8.0 的新功能及特性,更好地协助用户构建生成式 AI 实时系统。

演讲提纲

1. 现状与挑战

  • GenAI 时代的新需求
  • 现有数据处理系统架构的不足
  • 数据量与数据处理速度的取舍

2. 内存向量数据库

  • Redis 技术方案
  • 功能及性能优势

3. RAG 应用落地的痛点及解决方案

  • RAG 应用经常面临的问题
  • Redis 作为 RAG 应用的优势
  • 案例分享:金融业 RAG 使用场景及调优设计

4. 内存数据 vs 磁盘数据:速度与持久性的取舍?

  • 内存 + SSD 混合存储的技术难点
  • Redis 混合存储方案—— Redis Flex
  • 案例分享:Redis 混合存储使用场景及注意问题

5. 内存特征数据库

  • Redis 在线特征数据库的技术优势
  • 案例分享:在线特征数据库的使用场景

6. 总结与展望

实践痛点

  • GenAI 时代新的应用及框架层出不穷,用户很难做出选择
  • 不同 AI 应用很难协同运作,导致架构复杂,使用难度较高
  • Redis 版本过多,导致技术选型及架构设计很难统一
  • 国内客户对 Redis 原厂的最新技术及用例了解相对有限

演讲亮点

使数据架构同时满足安全性、准确性、稳定性、实时性、高吞吐需求的实践经验

听众收益

  • 了解 GenAI 实时处理数据架构的需求及解决方案
  • 了解 Redis 社区版 8.0 的全新特性
  • 了解 Redis 在不同行业 GenAI 应用的架构设计

交通指南

上海中谷小南国花园酒店

China Grain Hotel
地址:上海市杨浦区佳木斯路777号(近营口路口)
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手