DeepSeek 的横空出世,对 LLM 领域产生了多维度、深层次的变革,促进了... 展开 >




郭俊,字节跳动数据引擎团队负责人。负责火山引擎 EMR、LAS 的研发及产品等工作,同时负责字节跳动内部 Spark、Doris、Presto、native engine 等大数据引擎的研发及运维工作。
DeepSeek 的横空出世,对 LLM 领域产生了多维度、深层次的变革,促进了 LLM 技术的民主化及创新的去中心化。Multi-Agent 等技术也越来越流行。数据技术作为支撑 AI 技术发展的重要一环,将面临哪些挑战和革新?本专题将从 LLM、多模态数据处理、多模态数据湖、多模态数据管理等方向,结合头部企业实践,探讨大模型时代的 Data Infra 演进方向。
本专题讨论的方向包含:
数据资产的管理:如何面向大模型提供一套高效的数据管理平台,包含数据集管理、血缘管理、版本管理、算子管理等核心能力
面向大模型的多模态数据存储底座与存储格式:什么样的存储系统/范式以及存储格式能够应对非结构化数据,尤其多模态数据带来的挑战
计算范式及引擎:大模型数据处理往往需要异构计算资源,同时数据处理与分析的软件技术生态与传统大数据有较大差异
专题受众
数据处理团队:为大模型的训练或推理准备数据
大数据引擎团队:为 AI 场景设计并优化数据存储及计算引擎
算法团队:基于传统算法或大模型对多模数据进行处理,如内容识别和内容生成
随着 LLM 和多模态 AI 技术的飞速发展,非结构化数据量呈指数级增长,这极大地增加了数据管理、检索、计算和存储的复杂性。传统的数据湖解决方案已难以适应 AI 场景下对数据的新需求。
为了应对这一挑战,新一代数据湖必须解决以下多模态数据带来的关键问题:
本次演讲我将分享下一代多模态数据湖探索与实践,包含新一代的技术架构,关键开源技术的更迭等。
演讲提纲
1. 传统数据湖架构面临的挑战
2. 下一代面向 AI 的多模态数据湖
3. AI 数据湖的实践案例
4. 未来规划与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
随着 AI 与多模态应用的爆发式增长,现有数据湖架构在处理文本、图像、音频、视频等多模数据时面临数据延迟高、查询效率低等挑战。本次分享我将介绍如何结合 Fluss(实时流存储)与 Lance(多模态湖),高效构建一个支持实时写入、高效检索的多模态数据湖架构。我们将深入分析 Fluss 的湖流一体架构设计,以及在该架构中无缝集成 Lance,并通过一个 Python 开发的 demo展示如何便捷地构建实时多模态数据湖。
演讲提纲
1. 背景与问题
2. 核心技术介绍
3. 湖流一体架构实践
4. 实战 Demo
5. 总结与价值
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
本次演讲我将分享如何基于 Ray 构建高效的分布式 AI 架构,重点解决多模态数据处理、近离线的大模型推理链路和强化学习训练工程三大挑战。通过流批一体的推理管道实现近线和离线的统一及异构资源整合的灵活弹性计算。训练方面通过 Ray 的强大底座优化强化学习 Verl 框架,实现异构组网 + 异步训练的高效模式。过程展示这套方案如何通过统一的技术框架,在保证稳定性的同时提升模型推理和训练效率,为 AI 工程化提供端到端的优化方案。
演讲提纲
1. 场景概况和痛点
2. 基于 Ray 构建的分布式数据管道
3. Ray+Verl 的强化学习训练优化
4. 总结展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

