黄维啸,月之暗面系统工程师。毕业于清华大学,7 年 AI Infra 系统经验。目前在月之暗面负责 Infra 平台、系统优化相关工作。曾在旷视科技公司主导公司 AI 平台 Brain++ 从 0 到 1 的研发工作。

黄维啸,月之暗面系统工程师。毕业于清华大学,7 年 AI Infra 系统经验。目前在月之暗面负责 Infra 平台、系统优化相关工作。曾在旷视科技公司主导公司 AI 平台 Brain++ 从 0 到 1 的研发工作。
随着大模型训练的 Scaling up,对于基础设施的稳定性和高效性提出了更高的要求。本次演讲我将分享月之暗面在训推混部集群中的实践经验,重点探讨如何快速定位并隔离故障,实现任务的高效恢复,从而提升系统整体稳定性。同时,我还会分享如何在资源有限的情况下最大化利用率,避免浪费,进一步将该思路应用于强化学习任务的训练中。希望能为关注大规模模型训练的同行们提供一些可靠的技术思考与实践参考。
演讲提纲
1. 大规模训练推理集群的挑战
2. 提高训推混部集群稳定性和资源利用率
3. 通过混合架构提高强化学习效率
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
微信联系我们

