大模型存储加速论坛,聚焦探讨大模型时代的存储挑战与技术革新,共同研究高效存储方案... 展开 >





阮若夷,蚂蚁集团资深技术专家,存储与多媒体技术负责人,Ray 中文社区创始人。从事大数据系统、分布式系统和计算、存储数据库领域相关工作十五年。
大模型存储加速论坛,聚焦探讨大模型时代的存储挑战与技术革新,共同研究高效存储方案,加速 AI 应用落地。
当前随着大模型技术的快速发展,训练的数据规模越来越大,e.g., 在多模态场景中,单次训练的图片数量可能达到十亿甚至百亿级别并且需要同时处理视频、图片、音频、文本等多种模态数据。训练任务运行时 checkpoint 写入频率也在逐步加快,从天到分钟间隔,对于千亿以上参数规模的训练任务每秒写入吞吐会达到 TB 级数据。为了提高训练效率,减少训练过程中因数据读写开销导致的 GPU 资源浪费,蚂蚁构建了一套大模型缓存加速系统 PCache,具备百亿文件的元数据管理和横向扩展能力;同时采用近端加速以及面向 AI 数据特性的缓存策略,从数据预处理、样本读取、模型加载,到 checkpoint 写入,为训练任务提供数据读写完整的高性能和低成本的解决方案。除此之外,为了适应当前多 AI 算力中心的趋势,PCache 还采用云原生的架构,加快了建站效率和故障时的高可用性;以及通过全增量一体数据同步系统提高了各 AI 站点之间的数据迁移效率,为训练任务的算力调度提供了基础保障。
演讲提纲:
1. 背景介绍:业界和蚂蚁大模型存储需求 & 问题
2. 蚂蚁大模型存储加速整体架构
3. 大模型读写性能优化
4. 稳定性 & 产品易用性
听众收益:
方案痛点:
AI 大模型训练是当前最火的话题,我们发现 AI 大模型训练对于云存储有这巨大的挑战,数据链路的加速能力对于大模型训练任务对性能和稳定有这巨大对影响。在这个演讲中,我将分享这些挑战的根因以及阿里云如何构建分布式缓存产品来应对这些挑战。
DatasetAcc 是阿里云倾力打造的一款全托管弹性 PaaS 数据服务产品,提供面向机器学习场景深度优化的数据加速服务,旨在有效解决云端 AI 任务在数据访问层面所面临的效率瓶颈。该服务通过近端缓存技术为 GPU 驱动的机器学习任务量身定制了加速机制,能够广泛支持包括 OSS、NAS、CPFS 以及 MaxCompute 在内的多种云上数据源,无论是结构化还是非结构化数据,都能有显著的访问速度提升。针对机器学习训练过程中特有的随机小文件 IO 需求和独特的模型数据加载特性,DatasetAcc 进行了深入细致的场景适应性优化设计。其提供了一套面向各类云原生训练引擎的一体化数据集访问加速方案,确保了从数据加载到模型训练整个过程中的高效数据流转,并最终助推 AI 训练任务提效加速。
华为云通过 SFS Turbo 与 OBS 联动提供了大容量、高可靠、低成本的数据持久化层和高效的缓存加速层。作为 Al 训练加速器的 SFS Turbo 通过 MDS Turbo 和全路径软硬件优化实现了低时延数据流传、元数据千万级 IOPS、百亿小文件预热与数据载入加速;通过 AlTurbo 融入 Al 训推生态,与 Mindspore 等计算框架融合,实现了可靠的内存检查点,达成了万卡集群的秒级检查点快存、快恢。
本次演讲将从技术架构角度解读华云存储的一站式数据管理、存储、加速方案。
听众收益:
方案痛点:



微信咨询

电话咨询
微信联系我们

