基于 Ray 的 AI 工程化实践:大模型端到端的训推链路优化

所属专题:Data Infra for AI

嘉宾 : 郑志升 | 哔哩哔哩技术专家

会议室 : 台州宴会厅 2

讲师介绍

专题演讲嘉宾:郑志升

哔哩哔哩技术专家

郑志升,哔哩哔哩(B 站)基础架构部技术专家,10 多年大数据平台和架构相关经验,从 0 到 1 搭建 B 站实时端到端的传输、计算和数据湖体系,主要涵盖了 Flink、Spark、Iceberg/HUDI、Ray 等计算设施。近两年主要聚焦于大模型的训练和推理工程化建设,围绕 Verl、Vllm、SGLang 等大模型训推组件,打造基于 Ray 之上的新一代 AI Infra 计算底座。

议题介绍

地点:台州宴会厅 2
所属专题:Data Infra for AI

演讲:基于 Ray 的 AI 工程化实践:大模型端到端的训推链路优化

本次演讲我将分享如何基于 Ray 构建高效的分布式 AI 架构,重点解决多模态数据处理、近离线的大模型推理链路和强化学习训练工程三大挑战。通过流批一体的推理管道实现近线和离线的统一及异构资源整合的灵活弹性计算。训练方面通过 Ray 的强大底座优化强化学习 Verl 框架,实现异构组网 + 异步训练的高效模式。过程展示这套方案如何通过统一的技术框架,在保证稳定性的同时提升模型推理和训练效率,为 AI 工程化提供端到端的优化方案。

演讲提纲

1. 场景概况和痛点

  • 多模态 / 多源异构数据的规模化处理瓶颈
  • 大规模离线推理/回刷的时效性与成本困局
  • 大模型 RL 训练的资源利用率与迭代效率优化

2. 基于 Ray 构建的分布式数据管道

  • 流批一体及 Checkpoint
  • 结合 LLM 的分布式推理
  • 潮汐混部资源的弹性融入
  • 多模态数据链路的工程落地实践

3. Ray+Verl 的强化学习训练优化

  • 训练效率分析
  • 异构组网 + 异步通信实现

4. 总结展望

  • 多模态管道、底层能力、分布式推理、分布式训练

您认为,这样的技术在实践过程中有哪些痛点?

  • 各类异构资源的融合
  • RL 训练过程的效率挑战
  • 业务离近线推理的工程复杂

演讲亮点

  • 内容上聚焦当下大模型的各个环节,从数据处理、推理到 RL 训练的实践

听众收益

  • AI 工程团队:了解大模型的 GRPO 训练等 RL 工程的效率问题及相应解决方案
  • 数据工程团队:了解如何通过 Ray 实现高效的多模态数据处理,大模型分布式推理应用

交通指南

上海浦东滨江喜来登酒店

SHERATON SHANGHAI PUDONG RIVERSIDE
地址:上海浦东大道2288号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手