万卡集群在执行大规模网络模型训练任务时负载重,受到功耗挑战、网络拓扑、可靠性和故障恢复、并行计算、成本分析等多方面的挑战。越来越多开发者希望更好地驾驭万卡集群,提升大规模网络模型在万卡集群训练的集群整体性能。本议题旨在深入探索如何在万卡昇腾 NPU 集群上,基于业界典型 AI 框架和 MindSpeed 分布式并行加速库,结合网络拓扑优化算法和华为开源 HCCL 集合通信库协同优化,将深入剖析万卡集群训练过程中涉及的技术原理和难点,探讨万卡集群训练的性能和稳定性策略,最后结合案例讲解面向万卡集群性能提升的实践。
演讲提纲
1. 万卡集群的核心技术栈
- 分层万卡集群的技术栈及核心场景
- 智算场景下分布式加速库相关的使用新趋势
2. 万卡集群可观测数据采集和处理的需求和技术难点
- 根据智算服务部署、数据规模、多租的特点,如何稳定低实现万卡集群训练大模型
- 如何应对大规模智算集群性能提升
3. 万卡集群的性能提升架构设计
- 整体设计目标与愿景
- 围绕性能提升、稳定性、生态能力等方面,展开介绍核心架构
4. 万卡集群的未来展望
实践痛点
- 如何有效实现秒级别的快速恢复能力,提升大模型训练的集群稳定性
- 如何确保在网络拓扑等资源约束下提升集群算力可用率 MFU
- 如何与业务场景相结合,在大模型训练提升性能场景下保持训练精度
演讲亮点
- 深入探索面向万卡集群训练大规模模型的技术架构,该架构以卓越性能为核心,依托高稳定性的系统设计,实现万卡集群性能提升
- 贴近实际大模型训练的业务场景,超大规模模型 LLM/MLM 进行训练的技术实践,包括不限于分布式并行算法、集合通信优化算法等
听众收益
- 了解万卡集群训练的核心技术与发展趋势
- 结合华为昇腾相关技术,深入到万卡集群训练核心技术原理和实现细节
- 帮助听众理解万卡集群训练的技术挑战,集群性能提升的未来发展方向