人工智能正在从“感知”走向“行动”,由大模型驱动的具身智能正成为下一代 AI 的前沿方向。随着 o1/R1 系列的发布,训练范式正在从纯数据驱动的预训练/后训练,转向奖励信号驱动的强化学习(RL),未来 RL 所需算力甚至将超过预训练。然而,现有 RL 框架在面对具身智能的规模化训练时仍然捉襟见肘:一方面,具身智能存在“大脑–小脑–复合”架构的模型异质性;另一方面,其“渲训推一体化”特性带来了仿真、渲染与训练/推理的算力竞争。
为此,我们提出 RLinf ——首个面向具身智能的高可扩展与自适应大规模 RL 框架。RLinf 的 “inf” 既代表 infrastructure,也象征 infinite scaling。它通过 混合式执行模式、多后端集成方案 和 动态调度机制,在具身场景中实现超过 120% 的加速,并在 VLA 模型上带来 40–60% 性能提升。同时,RLinf 的通用性也已在数学推理等跨领域任务中验证,取得 AIME24/25 和 GPQA-diamond 等基准的 SOTA 表现。
本次演讲我将分享 RLinf 的设计理念与关键创新,并分享其在具身智能与跨领域应用中的系统级成果。
演讲提纲
1. 背景与趋势
• 从感知到行动:具身智能成为 AI 新前沿
• o1/R1 引领范式转变:奖励驱动的 RL 取代纯数据驱动
• RL 基础设施的重要性与现有框架的不足
2. 具身智能的独特挑战
• 模型异质性:大脑(推理)+ 小脑(执行)+ 复合架构
• 渲训推一体化:仿真、渲染与训练/推理并行,资源冲突严重
3. RLinf 框架设计与创新
• 混合执行模式:流水化无“气泡”,>120% 加速
• 多后端集成:VLM 用 Megatron+SGLang,VLA 用 FSDP+HF
• 动态通信与调度:负载均衡,自动扩缩容
4. 应用实践
• 具身智能:覆盖百余类任务,VLA 提升 40–60%
• 跨领域:数学推理模型在 AIME、GPQA 基准上达到 SOTA
5. 总结与展望
• RL 正在重塑大模型训练
• RLinf = 高效、省力、可扩展的具身智能 RL 基础设施
• 助力科研与产业走向下一代通用智能
实践痛点
- 要支撑如此庞大的训练算力需求,RL 基础设施(RL infra)的效率和可扩展性变得至关重要。然而,现有框架虽然在传统 RL 与 LLM 后训练上已有突破,但在面向具身智能的规模化 RL上却仍是一片空白。
演讲亮点
- 首创混合执行模型,结合分离式与共享式优势,通过细粒度流水线设计消除系统“气泡”
- 同时支持“大脑”和“小脑”等异构模型的差异化需求,为 VLA 模型带来 40-60% 的性能提升
- 大规模分布式训练中,实现真正的按需扩缩,最大化 GPU 利用率
听众收益
- 用同样硬件获得更高训练效率
- 快速上手具身智能与跨领域任务
- 系统化文档 + 智能助手 + 开源社区支持
- 面向未来的持续进化科研生态