袁彬航是香港科技大学(HKUST)计算机科学与工程系(CSE)的助理教授。他在莱斯大学(Rice University)获得博士学位和硕士学位,并在复旦大学获得学士学位。在加入香港科技大学之前,他曾在瑞士联邦理工学院苏黎世分校(ETH Zurich)担任博士后研究员。主要研究方向包括大语言模型服务系统,面向机器学习的数据管理系统,以及分布式和去中心化的机器学习系统。他曾经获得2019年VLDB最佳论文提名奖,2020年SIGMOD研究亮点奖。
袁彬航是香港科技大学(HKUST)计算机科学与工程系(CSE)的助理教授。他在莱斯大学(Rice University)获得博士学位和硕士学位,并在复旦大学获得学士学位。在加入香港科技大学之前,他曾在瑞士联邦理工学院苏黎世分校(ETH Zurich)担任博士后研究员。主要研究方向包括大语言模型服务系统,面向机器学习的数据管理系统,以及分布式和去中心化的机器学习系统。他曾经获得2019年VLDB最佳论文提名奖,2020年SIGMOD研究亮点奖。
随着 Coding Agent、企业智能助手等 Agent 应用进入真实生产环境,如何让 Agent 在持续使用过程中不断提升能力,成为下一阶段的重要挑战。传统 Agent 系统产生的大量交互轨迹、工具调用记录和用户反馈通常仅用于日志分析,难以转化为模型能力提升的数据闭环。
本次分享介绍 AReaL 2.0 如何构建面向 Agent 自演进的在线强化学习基础设施。方案通过 Agent 轨迹协议、数据代理层和演进控制平面,将真实业务交互转化为可训练、可回放、可治理的数据,并通过微服务化 Agent-Compute 架构,实现无需重构原有 Agent 即可接入 Online RL。在 Hermes Agent 和软件工程 Agent 场景中,该方案支持大规模并发环境、异步训练和持续优化,使 Agent 从“一次性执行系统”逐步演进为“持续学习系统”。
演讲提纲:
实践痛点:
演讲前沿亮点:
听众收益:
本次分享将帮助听众理解 Agent 基础设施发展的下一阶段趋势:从传统的模型调用和工作流编排,进一步发展到能够持续学习和自我优化的智能体系统。
技术层面,听众可以了解如何构建 Agent Online RL 闭环,包括轨迹协议设计、生产数据采集、Serving 与 Training 融合、奖励反馈管理以及模型更新流程。
工程实践层面,分享将总结真实部署中的关键经验,包括为什么简单日志无法支撑强化学习、为什么在线更新容易导致系统退化、如何通过数据治理和版本管理保障生产稳定性。
对于正在建设企业级 Agent 平台的团队,本次分享能够提供一种新的系统设计思路:无需推倒已有 Agent 架构,而是通过基础设施升级,将现有 Agent 转变为具备持续优化能力的学习型系统,为未来构建“越使用越强”的 AI 应用提供参考。



微信咨询

电话咨询
微信联系我们

