现任快手大模型训练引擎负责人,致力于提升基础大模型的训练效率。有 Colossal-AI、Megatron-LM 等多个开源训练框架的架构设计和研发经验,主导并参与了数千卡规模的大模型训练工作。

现任快手大模型训练引擎负责人,致力于提升基础大模型的训练效率。有 Colossal-AI、Megatron-LM 等多个开源训练框架的架构设计和研发经验,主导并参与了数千卡规模的大模型训练工作。
快手总结了一套超大规模集群下大语言模型训练方案。该方案在超长文本场景下,在不改变模型表现的情况下,训练效率相较 SOTA 开源方案,有显著的吞吐提升。通过细致的建模,可保证 Performance Model 十分接近真实性能,基于此 Performance Model,解决了大模型训练调参困难的问题。
本次演讲将结合在快手超算集群上的大模型训练经验,阐述大模型训练在超大规模集群下遇到的挑战和热点问题的演变,以及对应的解决方案。同时,针对最具挑战的超长文本场景,进行案例分析。最后,会根据未来大模型的发展趋势,对训练领域的技术探索方向进行探讨。
演讲提纲:
1. 背景与趋势
2. 大模型训练在超大规模集群下的挑战与解决方案
3. 超长文本场景的案例分析
4. 未来趋势与技术探索
听众收益:
方案痛点:



微信咨询

电话咨询
微信联系我们

