LLM 的潮流方兴未艾,智能 Agent 的时代又将到来。在这一波 AI 浪潮之... 展开 >









堵俊平,明星初创企业 Datastrato 的 Founder & CEO, 在数据与 AI 赛道耕耘十数年,曾任 LF AI & DATA 基金会董事主席,500 强企业开源战略与生态负责人,前腾讯开源联盟主席及数据平台总监,前 Hortonworks Hadoop 团队技术 Leader 等。
LLM 的潮流方兴未艾,智能 Agent 的时代又将到来。在这一波 AI 浪潮之下,数据技术作为 AI 的基石,又将产生哪些革命和颠覆性的突破?本专题将从 LLM、智能 Agent、RAG 等不同的热点领域方向,来探讨新一代 Data 技术的突破方向与思路。
本专题讨论的方向涵盖:
通过本专题,参会者可以学习如何识别和管理数据资产,掌握数据治理的新方法,了解不同行业如何利用数据技术和 AI 进行创新和转型,为未来的技术革新和业务发展做好准备。
在过去的几年里,数据湖方案从快速兴起,到被众多客户广为接受。在当下的时间点,数据湖方案已经相对足够成熟,能够应对客户的海量大数据分析场景。随着近期的大模型潮流兴起,又对数据湖方案提出了更大的挑战。例如:传统 HMS 上云的种种问题、Catalog 在大数据和 AI 上的割裂、AI 对 IO 访问模式的新需求、云上构建传统数仓的困难以及生态的问题等等。在本次 Talk 中,我会分享上述挑战,并说明我们的解决之道。
演讲提纲
1. LLM 场景下对传统数据湖方案提出的挑战
2. 火山引擎的解决之道及最佳实践
3. 经验总结和未来展望
实践痛点
演讲亮点
大模型对数据湖提出的新挑战,包括半结构化、非结构化 、AI 模型数据的管理,以及 IO 访问的针对性优化
听众收益
在 AGI 时代,为构建一个高质量的 LLM 应用,对数据提出了新的需求。无论是数据的覆盖范围,还是数据的准确性,都对 LLM 应用的质量起到了决定性的作用。更为重要的是,LLM 使得非结构化数据的聚集以及处理变得非常关键:如何能获取并管理海量的结构化尤其是非结构化数据,如何全链路支持 LLM 的训练、调优、推理所需要的数据,解决大模型的“幻觉”,构建企业级的 RAG 应用,统一数据目录成为每个企业亟待解决的问题与挑战。本次分享会为大家介绍企业在 AGI 时代所面临的最直接的数据挑战,包括:难以高效地管理、获取全域数据,缺乏统一地进行数据治理和权限控制,传统的数据湖体系和 GenAI 框架之间的鸿沟等等。为了应对这些挑战,我们研发了Apache Gravitino项目,并做了很多前沿创新,包括:统一的结构化和非结构化数据模型来统一管理异构以及跨云跨域的数据,统一权限模型来简化云上和云下数据的管理,在主流框架如 LangChain、LlamaIndex 以及 Vector Store 的基础上构建下一代企业级 Data Agent 来解决当前 RAG 方案的系统性问题等等。除了技术设计和实现的细节,本次分享也会结合这些技术在小米的大规模实践来为大家带来下一代数据目录体系的最佳实践。通过这次分享,听众对于构建下一代面向 GenAI 的统一数据平台会有更多的实践经验。
演讲提纲
1. 背景 & 挑战
2. 策略:通过前沿技术 Gravitino 来解决 GenAI 时代的统一数据管理
3. 策略:构建统一的权限模型来统一管理云上和云下数据
4. 实践:小米构建下一代面向 GenAI 的统一数据平台
5. 总结与展望
实践痛点
AI 的统一元数据基座,在实践过程中面临几个挑战:
演讲亮点
听众收益
人工智能是一项变革性技术,PayPal 开发了许多数据系统和AI工具来来解决各种业务的数据需求,包括欺诈检测、提高运营效率、为客户提供个性化服务和优惠、履行监管义务等等。几年前,当PayPal 开始将大数据和 AI/ML 扩展到所有核心业务领域时,越来越明显的发现,拥有一组定制数据系统和 AI 工具(通常在自己的数据孤岛中构建和运行)无法满足整个企业大规模采用大数据和 AI/ML 数据科学的需求。
为了解决上述问题,PayPal 设计并实现了一个统一的端到端的 AI/ML 数据科学平台,目标用户涵盖了公司内部不同业务部门(风控,合规、客户服务等),每天有成千上万的 Data Scientist 和Data Analyst 使用其来开发 Data Science和Machine Learning 解决方案。在生产中,数千个ML模型每天在本地和云端处理数百亿个实时和批量数据推理请求,从而满足整个 PayPal 公司的广泛业务需求。
本次演讲将重点分享如何实现企业级 AI for Data 平台的统一扩展与优化,以及 LLMOps 在 GenAI 应用中的实践经验。
演讲提纲
1. 传统的 AI for Data 平台面临的问题与挑战
2. 构建企业级 AI for Data 平台的指导原则与最佳实践
3. 从 MLOps 到 LLMOps,面向下一代 GenAI 的支持
4. GenAI for Data 架构详解与案例分析
5. 总结与展望
实践痛点
演讲亮点
听众收益
AI 时代来了,无论你在打造基础模型,领域模型,还是要构建 AI 应用,利用 AI 技术优化现有业务。无一例外的是,越来越多的数据都是我们的核心资产,这是存储系统的挑战,也是用户做技术选型的难题。存储系统的选择不仅是选择容量、性能和成本,通用硬件兼容性、弹性、性能影响因素、性能扩展方式、客户端协议等诸多因素是实际影响业务体验的。
JuiceFS 是一款为大规模数据高性能负载设计的分布式文件系统,从 2019 年开始支持 AI 和机器学习领域,包括自动驾驶、量化金融、还有近两年最热门的生成式 AI 和大语言模型。
在为数十家 AI 企业提供服务后,希望在这次演讲中分享一下我收获的经验和思考。
演讲提纲
1. 用户视角下,存储系统选型和维护的挑战是什么?
2. 存储系统选型中经常面临的选择
3. 成本 v.s. 性能的取舍与平衡要从架构设计开始
4. 一个生成式 AI 领域的案例分享
演讲亮点
JuiceFS 是为云环境设计的整体技术架构,应该是文件存储领域的首创(2017 年)。也创新性的在架构设计上讲存储系统的容量与性能解耦,这样的设计为系统容量规划,性价比两个方面为用户带来明显的收益。
实践痛点
JuiceFS 为海量数据高吞吐业务场景设计和优化,对于少量数据和需要低时延的业务场景,JuiceFS 并不适用。
听众收益
存储系统是一个看似普通常见,但在不同业务中又是一个复杂的话题。架构师做选型决策时往往处于业务初期,并不能预测后面的变化,而存储系统在业务架构中是最难替换和迭代的。本次演讲结合目前 AI 领域的发展特点,和分享人过去 5 年服务不同领域 AI 客户的经验,让听众在分享中:
架构设计没有银弹,都是取舍。灵活简单算是一剂解药。
自 LLM 问世以来,向量数据库一直扮演着 Infra for AI 的领跑者,在这个领域我们见到了蓬勃发展的应用场景和案例,向量检索也从最初的一枝独秀到现在的百花齐放。随着 RAG 和多模态的普及,用户对检索器(向量数据库或其他系统)的检索能力提出了更高需求,我们从应用场景和技术落地看到了对各种新技术的需求和潜力,我们将从底层技术实现到使用场景来全面的分享这些重要能力,并且分享我们从实践中应证的它们价值。
本次分享也将从我们自己的 RAG 场景(milvus 知识库)出发,分享我们在 RAG 方面看到的挑战,以及我们通过采用混合检索技术和其他技巧,最终把准确率提升到 90% 以上的经验分享,此外会将分享我们在该项目落地中所收获的经验并探讨未来 RAG 与向量检索的方向。
演讲提纲
1. RAG 场景下的数据检索问题及其挑战
2. Milvus 的应对之道
3. Milvus Ask AI:准确率提升至 90% 的企业 RAG 服务实践
4. 向量检索与 RAG 的未来发展
听众收益
1. 开拓一些新思路,用新方法如何解决传统的一些搜索问题
2.了解向量数据库以及 embedding & reranking 最前沿的技术和成果
3. 了解混合检索(倒排关键词、sparse、dense)在 RAG 和多模态检索场景里的打开方式
4. 目前领域相关的挑战,以及向量数据库的最新技术和 RAG 的未来展望
随着人工智能业务的迅速发展,AI 模型训练所需的数据规模不断扩大,应用场景也逐步从云下延伸至云上。这给作为 AI 基础设施的分布式文件存储平台 CubeFS 带来了新的挑战。为应对这些挑战,CubeFS 加强了多协议接入能力,以满足多样生态数据的统一入湖和存算分离需求。同时,创新性地采用数据生命周期技术,实现智能数据分层调度,降低成本并提升效率,极大扩展了数据调度和整合的应用场景。最后,为解决云上对私有云存储的访问延时等问题,CubeFS 实现了分布式缓存和 RDMA 加速技术,构建了全链路的多维度 AI 加速解决方案。
演讲提纲
1. AI 数据存储的特点
2. AI 存储在混合云场景下面临的技术挑战
3. CubeFS 支撑 AI 存储的技术要点与实践
4. 面向 AI 存储构建下一代混合云存储的方案
演讲亮点
实践痛点
老架构复杂度增加,是否重构还是在原有基础上构建的 tradeoff
听众收益
过去的一年中,我们共同见证了生成式AI从起步到狂奔、再到各行各业的遍地开花。与此同时,生成式AI应用也对数据处理架构提出了新的挑战:如何在海量的私有数据中构建更加安全、更加准确、更加稳定、更高吞吐的 AI 应用,并满足用户对实时性的需求。
在本次分享中,我们将从 Redis 原厂的视角,结合 Redis 全球客户的使用案例,探讨 Redis 是如何在生成式 AI 时代应对数据处理平台的如下挑战:
除此之外,本次分享也会简要介绍 Redis 8.0 的新功能及特性,更好地协助用户构建生成式 AI 实时系统。
演讲提纲
1. 现状与挑战
2. 内存向量数据库
3. RAG 应用落地的痛点及解决方案
4. 内存数据 vs 磁盘数据:速度与持久性的取舍?
5. 内存特征数据库
6. 总结与展望
实践痛点
演讲亮点
使数据架构同时满足安全性、准确性、稳定性、实时性、高吞吐需求的实践经验
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

