大模型训练和推理工程

会议室: VIP 1
出品人:薛超

大模型训练与推理的工程专题聚焦于如何优化训练流程以实现效率跃升,并致力于探究如何... 展开 >

专题出品人:薛超

京东探索研究院算法科学家,系统与基础模型部机构负责人

薛超,现任京东探索研究院算法科学家,系统与基础模型部机构负责人,致力于京东基础大模型的训练和推理。主导并参与了多项云计算平台的大数据服务、自动化机器学习服务在国内外大型企业的研发与落地。在人工智能与计算机体系结构等国际顶级会议和期刊上发表 10 余篇文章,授权美国发明专利 40 余项。

地点: VIP 1

专题:大模型训练和推理工程

大模型训练与推理的工程专题聚焦于如何优化训练流程以实现效率跃升,并致力于探究如何提升推理阶段的速度表现。

by 卞正达

北京潞晨科技有限公司
CTO

随着视频内容创作和消费的迅猛增长,OpenAI Sora 凭借其出色的视频生成技术成为行业的领跑者。紧随其后,Colossal-AI 团队率先推出类 Sora 架构开源视频生成模型 Open-Sora 1.0。

本次演讲将详细介绍 Open-Sora 1.0 的复现方案,包括其三个关键阶段的训练流程:大规模图像预训练、视频预训练和数据微调,以及这些步骤如何共同作用于提升生成视频的质量和真实感。此外,演讲还将探讨数据预处理、模型训练细节和加速优化策略,以及未来的发展计划。

演讲提纲:

  1. 视频生成模型的发展和背景
  2. Open-Sora 1.0:类 Sora 开源架构模型的介绍
  3. 数据预处理和模型训练细节的深入剖析
  4. 模型训练加速优化的策略和实践
  5. 未来计划和开源社区的参与方式

听众收益:

  • 深入了解 Open-Sora 1.0 模型,包括其在视频生成领域的创新应用和实际效果
  • 掌握模型的关键技术特点,学习高效数据处理与训练流程,实现高质量视频生成
  • 了解如何将先进技术应用于项目中,提升内容创作质量与效率。
  • 了解模型未来发展方向,把握视频生成技术最新趋势,激发研究或创作灵感

方案痛点:

  • 视频生成的成熟度。目前,Open-Sora 1.0 的视频生成功能尚未完全成熟,需要进一步优化以提高视频的时长、分辨率和整体质量

  • 训练与推理优化。为了提升性能,Open-Sora 1.0 正在积极进行训练推理部分的优化工作,以期达到更高效的视频处理能力

by 刘育良

快手
AI 平台大模型训练负责人

快手总结了一套超大规模集群下大语言模型训练方案。该方案在超长文本场景下,在不改变模型表现的情况下,训练效率相较 SOTA 开源方案,有显著的吞吐提升。通过细致的建模,可保证 Performance Model 十分接近真实性能,基于此 Performance Model,解决了大模型训练调参困难的问题。

本次演讲将结合在快手超算集群上的大模型训练经验,阐述大模型训练在超大规模集群下遇到的挑战和热点问题的演变,以及对应的解决方案。同时,针对最具挑战的超长文本场景,进行案例分析。最后,会根据未来大模型的发展趋势,对训练领域的技术探索方向进行探讨。

演讲提纲:

1. 背景与趋势

  • 大模型的发展趋势
  • 分布式训练的主要难点

2. 大模型训练在超大规模集群下的挑战与解决方案

3. 超长文本场景的案例分析

4. 未来趋势与技术探索

听众收益:

  • 超大规模集群上,随着大模型的发展,热点问题的演变和解决方案
  • 快手在超长文本场景下的系统解决方案
  • 更多大模型训练技术的尝试与探讨

方案痛点:

  • 通过计算通信 Overlap 达成了训练吞吐加速,然而由于 GPU 没有独立通信器件导致通信会对计算造成影响,如果没有精细的调优会导致加速效果不符合预期

by 谢帅

京东
探索研究院算法工程师、系统与基础模型部推理小组负责人

by 谷鋆

NVIDIA
解决方案架构师

by 李一松

NVIDIA
高级软件解决方案架构师

交通指南

北京国测国际会议会展中心

GUOCE International Convention And Exhibition Center
地址:北京市顺义区临空经济核心区汇海南路6号院20号楼
  • 微信咨询

  • 电话咨询

    联系电话:+86 17310043226

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手