大模型在超大规模集群上的性能提升实践

所属专题:大模型基础设施与算力优化

嘉宾 : ZOMI 酱 | 华为昇腾生态技术首席

会议室 : 红宝石CD厅

讲师介绍

专题演讲嘉宾:ZOMI 酱

华为昇腾生态技术首席

ZOMI 酱,华为昇腾生态技术首席,博士,研究方向为多智能体强化学习、移动视觉和深度学习算法及其应用。曾参与分布式大型系统、多传感器融合系统等大型项目,多次获国家级创新项目奖。华为大学荣誉讲师,给孟晚舟、孟平总等公司高级领导人讲课。在 CCF、昇腾鲲鹏开发者大会、华为开发者大会等百人、千人场所进行技术分享。作为第一作者著有《 AI 系统》、《深度学习:原理与实践》、《深度强化学习:原理与实践》3 本专著,并累积发表了 113 篇发明类专利。B 站 AI 领域著名 UP 主( ZOMI 酱),全网播放量超千万。

 

议题介绍

演讲:大模型在超大规模集群上的性能提升实践

万卡集群在执行大规模网络模型训练任务时负载重,受到功耗挑战、网络拓扑、可靠性和故障恢复、并行计算、成本分析等多方面的挑战。越来越多开发者希望更好地驾驭万卡集群,提升大规模网络模型在万卡集群训练的集群整体性能。本议题旨在深入探索如何在万卡昇腾 NPU 集群上,基于业界典型 AI 框架和 MindSpeed 分布式并行加速库,结合网络拓扑优化算法和华为开源 HCCL 集合通信库协同优化,将深入剖析万卡集群训练过程中涉及的技术原理和难点,探讨万卡集群训练的性能和稳定性策略,最后结合案例讲解面向万卡集群性能提升的实践。

演讲提纲

1. 万卡集群的核心技术栈

  • 分层万卡集群的技术栈及核心场景
  • 智算场景下分布式加速库相关的使用新趋势

2. 万卡集群可观测数据采集和处理的需求和技术难点

  • 根据智算服务部署、数据规模、多租的特点,如何稳定低实现万卡集群训练大模型
  • 如何应对大规模智算集群性能提升

3. 万卡集群的性能提升架构设计

  • 整体设计目标与愿景
  • 围绕性能提升、稳定性、生态能力等方面,展开介绍核心架构

4. 万卡集群的未来展望

实践痛点

  • 如何有效实现秒级别的快速恢复能力,提升大模型训练的集群稳定性
  • 如何确保在网络拓扑等资源约束下提升集群算力可用率 MFU
  • 如何与业务场景相结合,在大模型训练提升性能场景下保持训练精度


演讲亮点

  • 深入探索面向万卡集群训练大规模模型的技术架构,该架构以卓越性能为核心,依托高稳定性的系统设计,实现万卡集群性能提升
  • 贴近实际大模型训练的业务场景,超大规模模型 LLM/MLM 进行训练的技术实践,包括不限于分布式并行算法、集合通信优化算法等

听众收益

  • 了解万卡集群训练的核心技术与发展趋势
  • 结合华为昇腾相关技术,深入到万卡集群训练核心技术原理和实现细节
  • 帮助听众理解万卡集群训练的技术挑战,集群性能提升的未来发展方向

交通指南

上海中谷小南国花园酒店

China Grain Hotel
地址:上海市杨浦区佳木斯路777号(近营口路口)
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手