毕业于浙江大学计算机专业,在分布式计算、存储系统、以及调度和弹性领域有着 10 年以上的工作经验。当前在蚂蚁集团负责 AI 缓存加速等多个产品的研发和架构工作,相关的产品覆盖多个 AI 和大数据的存储加速场景,提供百亿文件和 PB 级数据的训练加速能力。
当前随着大模型技术的快速发展,训练的数据规模越来越大,e.g., 在多模态场景中,单次训练的图片数量可能达到十亿甚至百亿级别并且需要同时处理视频、图片、音频、文本等多种模态数据。训练任务运行时 checkpoint 写入频率也在逐步加快,从天到分钟间隔,对于千亿以上参数规模的训练任务每秒写入吞吐会达到 TB 级数据。为了提高训练效率,减少训练过程中因数据读写开销导致的 GPU 资源浪费,蚂蚁构建了一套大模型缓存加速系统 PCache,具备百亿文件的元数据管理和横向扩展能力;同时采用近端加速以及面向 AI 数据特性的缓存策略,从数据预处理、样本读取、模型加载,到 checkpoint 写入,为训练任务提供数据读写完整的高性能和低成本的解决方案。除此之外,为了适应当前多 AI 算力中心的趋势,PCache 还采用云原生的架构,加快了建站效率和故障时的高可用性;以及通过全增量一体数据同步系统提高了各 AI 站点之间的数据迁移效率,为训练任务的算力调度提供了基础保障。
演讲提纲:
1. 背景介绍:业界和蚂蚁大模型存储需求 & 问题
2. 蚂蚁大模型存储加速整体架构
3. 大模型读写性能优化
4. 稳定性 & 产品易用性
听众收益:
方案痛点:



微信咨询

电话咨询
微信联系我们

