郑加利,华为高级工程师,主导 MindSpeed 框架基础架构设计构建,推动大模型训练效率的显著提升。主导微软大模型训练框架 DeepSpeed 原生支持华为昇腾软件栈,进一步拓展昇腾生态的兼容性。深度参与了华为昇腾的重点模型开发和客户项目攻关,多次获得昇腾领域总裁嘉奖令。

郑加利,华为高级工程师,主导 MindSpeed 框架基础架构设计构建,推动大模型训练效率的显著提升。主导微软大模型训练框架 DeepSpeed 原生支持华为昇腾软件栈,进一步拓展昇腾生态的兼容性。深度参与了华为昇腾的重点模型开发和客户项目攻关,多次获得昇腾领域总裁嘉奖令。
大模型的训练过程极其复杂,不仅涵盖了众多技术层面,同时也面临着巨大的挑战。面对巨大规模的模型参数量与计算量,单靠一张计算卡难以满足需求,必须依赖多张计算卡进行并行计算。然而,大规模集群计算带来的复杂性显著增加,这在一定程度上拖慢了模型训练的速度。在此背景下,本次分享我将介绍昇腾 MindSpeed 分布式训练加速库通过在计算、通信以及显存等多个维度上的优化措施,来加速模型的训练过程,有效提升了训练效率,为大模型的训练提供了强有力支持的实践案例。
演讲提纲
1. 大模型训练的趋势与挑战
2. 业界加速套件
3. MindSpeed 架构设计
4. MindSpeed 优化策略
5. MindSpeed 的实战效果
6. 未来展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
微信联系我们

