昇腾 MindSpeed:分布式训练加速库的创新实践与突破

所属专题:面向 AI 的研发基础设施

嘉宾 : 郑加利 | 华为高级工程师

会议室 : 北京厅2

讲师介绍

专题演讲嘉宾:郑加利

华为高级工程师

郑加利,华为高级工程师,主导 MindSpeed 框架基础架构设计构建,推动大模型训练效率的显著提升。主导微软大模型训练框架 DeepSpeed 原生支持华为昇腾软件栈,进一步拓展昇腾生态的兼容性。深度参与了华为昇腾的重点模型开发和客户项目攻关,多次获得昇腾领域总裁嘉奖令。

议题介绍

演讲:昇腾 MindSpeed:分布式训练加速库的创新实践与突破

大模型的训练过程极其复杂,不仅涵盖了众多技术层面,同时也面临着巨大的挑战。面对巨大规模的模型参数量与计算量,单靠一张计算卡难以满足需求,必须依赖多张计算卡进行并行计算。然而,大规模集群计算带来的复杂性显著增加,这在一定程度上拖慢了模型训练的速度。在此背景下,本次分享我将介绍昇腾 MindSpeed 分布式训练加速库通过在计算、通信以及显存等多个维度上的优化措施,来加速模型的训练过程,有效提升了训练效率,为大模型的训练提供了强有力支持的实践案例。

演讲提纲

1. 大模型训练的趋势与挑战

  • 模型规模与计算需求:大模型参数量与计算量的指数级增长
  • 分布式训练的复杂性:大规模集群计算带来的挑战
  • 效率瓶颈:现有解决方案的局限性

2. 业界加速套件

  • 主流加速库的特点与不足
  • 昇腾 MindSpeed 的差异化优势

3. MindSpeed 架构设计

  • 整体架构概览
  • 核心模块与功能

4. MindSpeed 优化策略

  • 通信优化
    • 高效通信协议与算法
    • 通信性能提升案例
  • 内存优化
    • 显存管理与优化技术
    • 内存优化的实际效果
  • 计算优化
    • 算法加速与硬件适配
    • 计算效率提升的关键点
  • 并行优化
    • 并行策略的灵活组合与实践

5. MindSpeed 的实战效果

  • 性能提升案例:具体模型训练的加速效果
  • 效率提升:训练时间缩短与资源利用率提升
  • 行业应用:MindSpeed 在不同场景中的落地实践

6. 未来展望

  • 昇腾 MindSpeed 的发展方向
  • 对大模型训练的持续支持与创新

您认为,这样的技术在实践过程中有哪些痛点?

  • 在此次演讲中提到的大部分技术点都属于使用场景广泛,成本较小。并行优化中会有一些优化点开发工作量相对较多

演讲亮点

  • 显存优化中通过 BF16 与 FP32 数据格式同指数位的特点,共享显存地址,以节省显存开销,当前业界无此方案

听众收益

  • 了解昇腾分布式训练加速库的一些前沿的技术和成果
  • 开拓一些新思路,用新想法解决大模型中的显存和通信耗时

交通指南

北京石景山万达嘉华酒店

Wanda Jin
地址:北京市石景山区石景山路甲18号院
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手