专题演讲嘉宾:刘键

蚂蚁集团高级技术专家

毕业于浙江大学计算机专业,在分布式计算、存储系统、以及调度和弹性领域有着 10 年以上的工作经验。当前在蚂蚁集团负责 AI 缓存加速等多个产品的研发和架构工作,相关的产品覆盖多个 AI 和大数据的存储加速场景,提供百亿文件和 PB 级数据的训练加速能力。

by 刘键

蚂蚁集团
高级技术专家

当前随着大模型技术的快速发展,训练的数据规模越来越大,e.g., 在多模态场景中,单次训练的图片数量可能达到十亿甚至百亿级别并且需要同时处理视频、图片、音频、文本等多种模态数据。训练任务运行时 checkpoint 写入频率也在逐步加快,从天到分钟间隔,对于千亿以上参数规模的训练任务每秒写入吞吐会达到 TB 级数据。为了提高训练效率,减少训练过程中因数据读写开销导致的 GPU 资源浪费,蚂蚁构建了一套大模型缓存加速系统 PCache,具备百亿文件的元数据管理和横向扩展能力;同时采用近端加速以及面向 AI 数据特性的缓存策略,从数据预处理、样本读取、模型加载,到 checkpoint 写入,为训练任务提供数据读写完整的高性能和低成本的解决方案。除此之外,为了适应当前多 AI 算力中心的趋势,PCache 还采用云原生的架构,加快了建站效率和故障时的高可用性;以及通过全增量一体数据同步系统提高了各 AI 站点之间的数据迁移效率,为训练任务的算力调度提供了基础保障。

演讲提纲:

1. 背景介绍:业界和蚂蚁大模型存储需求 & 问题

2. 蚂蚁大模型存储加速整体架构

  • 多类型用户接入方案
  • 部署模式:和训练任务混部

3. 大模型读写性能优化

  • 海量文件元数据管理方案 (文件折叠 + 元数据服务 & 存储分离 + 联邦模式)
  • 面向 AI 数据特性的 cache 策略:读取加速 + 提高缓存效率

4. 稳定性 & 产品易用性

  • 云原生架构 + 高可用方案
  • 多站点/多存储之间的全量和增量数据同步系统

听众收益:

  • 了解大模型训练场景中存储可能碰到的问题
  • 如何结合存储服务的部署方案、元数据优化、面向 AI 数据特性的 cache 策略、和支持高吞吐的 checkpoint 写入能力为大模型训练任务提供完整的存储解决方案
  • 在大模型多算力中心的趋势下,如何提高存储的效率和产品易用性

方案痛点:

  • 和训练混部的这种近端加速方案,需要在网络和资源调度上做更好的规划,避免对训练任务的影响,e.g. 数据网络和参数网络

交通指南

北京国测国际会议会展中心

GUOCE International Convention And Exhibition Center
地址:北京市顺义区临空经济核心区汇海南路6号院20号楼
  • 微信咨询

  • 电话咨询

    联系电话:+86 17310043226

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手