专题演讲嘉宾:杜冬冬 博士

上海交通大学副教授

杜冬冬,博士,上海交通大学副教授。长期从事操作系统、智能体系统等方面研究工作,成果发表在SOSP、OSDI、ASPLOS、FAST等国际著名会议和期刊,并获SOSP 2025最佳论文奖及FAST 2026最佳论文奖和杰出技术成果奖。一系列成果已经在工业界和开源社区得到广泛应用,包括(1)蓬莱可信执行环境系统,目前是RISC-V架构下最常用的开源TEE系统之一;(2)D-VSync,作为传统VSync渲染技术的,目前已经在鸿蒙操作系统得到大规模部署和应用(千万规模设备),有效提升了终端场景下的用户体验;(3)Serverless低时延沙箱启动技术,首次实现毫秒级Serverless沙箱启动,并且在蚂蚁金服得到了大规模部署和应用;(4)并行化GPU启动gCROP,并且已经合入CRIU主线代码,是CRIU默认开启的应用restore加速技术。

by 杜冬冬 博士

上海交通大学
副教授

LLM 强化学习中,Rollout 占耗时的相当一大部分,长尾使最早完成 GPU 约 76% 时间空闲。通过大量数据,我们发现发现相邻 epoch 有大量的token 可匹配、因而结合历史推测解码与长度调度,提出 RhymeRL 系统。系统采用离线后缀树、奖励感知选枝、动态窗口、奇偶步互补及尾部迁移,解决在线索引开销、固定窗口无效验证和异常长样本失衡,并取得相比现有系统2.6x 的性能提升。

演讲提纲:

  1. 背景:强化学习后训练时代,瓶颈在 Rollout
    • RL 已成为大模型对齐与推理增强的标准手段
    • 实测 Rollout 占训练耗时 84%–91%(math/code RLVR),随训练响应从 2K 增至 11K+ token
    • 批内长尾导致最早完成 GPU大量时间空转
  2. 关键观察:相邻 epoch 的 Rollout 存在“相似性”
    • 基于真实轨迹分析:大量token可精确匹配上一 epoch
    • 响应长度排序稳定
  3. 设计目标
    • 不依赖额外小模型,复用 RL 已付费生成的历史响应
    • 保留 one-step-off 算法边界,避免全异步的样本丢弃与范式改变
    • 离线建索引、在线零额外开销,避免检索回到关键路径
  4. RhymeRL 的系统设计
    • HistoSpec:每个提示词一棵后缀树,O(m) 前缀查询;奖励感知选枝;类 AIMD 动态草稿窗口
    • HistoPipe:奇偶 step 长短互补调度;步内/跨步尾部迁移;两级 GPU 资源分配
    • 端到端闭环:响应、奖励、长度回写历史索引,先验随训练演进
  5. 实施效果与结论
    • 端到端吞吐最高为(基线版本的)的 2.6 倍;HistoSpec 单步 Rollout 吞吐最高 1.86 倍

实践痛点: 

  • 当前主要针对 math 和 code 进行比较深入的实践,更复杂动态的 agent RL 场景可能需求和问题不同。

前沿亮点:

  1. 不依赖于传统 speculative decoding 中对小模型能力的依赖
  2. 能够充分利用空闲算力提效

听众收益:

  1. 了解当前强化学习在 Rollout 阶段 Infra 侧主要开销
  2. 了解如何基于历史经验来优化当前的 Rollout

交通指南

上海建工浦江皇冠假日酒店

Shanghai Construction Group Pujiang Crowne Plaza Hotel
地址:上海市闵行区陈行公路 3701 号
  • 微信咨询

  • 电话咨询

    联系电话:18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手