在传统 AI 的黄金时代,大模型通过海量数据学会了“思考&rdquo... 展开 >




王铁震,Hugging Face 工程师,兼具实干精神与梦想追求,坚信开源是连接全球的纽带,让 AI 的益处普惠大众。他秉持"高手在民间"的理念,渴望激励更多的开源模型从业者成为行业的关键意见领袖,挖掘群体的智慧与潜能,促进社区的成长和影响力的扩大。
在传统 AI 的黄金时代,大模型通过海量数据学会了“思考”,但它们始终被困在数字世界——无法真正触摸、操作或感受物理环境。具身智能(Embodied AI)的崛起,正在打破这一界限,代表了人工智能从“看得见”到“摸得着”的一次思想跃迁。通过赋予 AI “身体”(机器人、机械臂、智能传感器等),我们不再只是训练它回答问题,而是让它通过动作与环境互动,像人类一样“动手思考”。
但真正的挑战在于:如何让 AI 的“大脑”和“身体”协同工作?如何构建能够在复杂环境中自主行为的 AI 系统? 本次专题将邀请全球顶尖研究者、工程师和创业者,探讨具身智能的关键技术、应用场景以及未来趋势,共同探寻这一新兴领域如何推动下一代 AI 的发展。
传统的具身智能操作方法将视觉感知、语言理解和动作规划分割为独立模块,导致系统复杂、误差易累积且泛化能力不足。视觉语言动作模型(VLA)则实现了从多模态感知到动作生成的端到端学习,构建了 “所见即所动” 的智能决策闭环,极大地推动了具身智能发展。
然而视觉语言动作模型本身也存在诸多挑战,例如训练数据难以获取、模型结构缺少长时序和物理逻辑推理的能力。这意味着 VLA 虽然能实现一些操作功能但是对不同场景、不同任务的泛化性仍然存在挑战,无法满足实际的需求。
本次演讲主要分享 VLA 技术的基本原理和机制,以及在落地过程中涉及到的数据、评测等问题, 从而提升 VLA 的性能和易用性。
演讲提纲
1. 具身智能 VLA 的现状及挑战
2. 分层式 VLA 架构
3. VLA 的数据方案
4. VLA 的量化部署
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
近年来,AI 技术的爆发为机器人真正走进千家万户铺平了道路。我们可以看到,各类新型机器人以及具身智能模型和应用正如雨后春笋般涌现,机器人的能力越来越强、应用场景也越来越丰富。然而,随之而来的一个现实问题却愈发凸显:不同品牌、不同类型的机器人往往采用各自不同的控制方式,而各类 AI 模型的接入、使用方法和适用场景也存在显著差异。对于普通用户来说,真正想让机器人为自己高效工作,依然面临着较高的技术门槛。要打破这一壁垒,核心在于通过技术手段实现标准化和抽象化。比如,构建统一的控制接口、适配多种模型的通用框架,降低机器人和 AI 技术的使用门槛,让用户无需关心底层技术细节,就能便捷地调动和管理各类智能硬件和应用,真正释放具身智能的价值。本次演讲将聚焦于如何基于浏览器构建一个面向多种机器人和 AI 模型的通用控制平台,分享其中的技术架构设计思路、关键挑战与实践经验。
演讲提纲
1. 机器人落地过程中的实际技术痛点
2. 为什么技术方案选在浏览器端
3. 浏览器中的可视化与物理仿真技术挑战
4. 控制系统的扩展性设计
5. 多机器人适配方案
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
人工智能正在从“感知”走向“行动”,由大模型驱动的具身智能正成为下一代 AI 的前沿方向。随着 o1/R1 系列的发布,训练范式正在从纯数据驱动的预训练/后训练,转向奖励信号驱动的强化学习(RL),未来 RL 所需算力甚至将超过预训练。然而,现有 RL 框架在面对具身智能的规模化训练时仍然捉襟见肘:一方面,具身智能存在“大脑–小脑–复合”架构的模型异质性;另一方面,其“渲训推一体化”特性带来了仿真、渲染与训练/推理的算力竞争。
为此,我们提出 RLinf ——首个面向具身智能的高可扩展与自适应大规模 RL 框架。RLinf 的 “inf” 既代表 infrastructure,也象征 infinite scaling。它通过 混合式执行模式、多后端集成方案 和 动态调度机制,在具身场景中实现超过 120% 的加速,并在 VLA 模型上带来 40–60% 性能提升。同时,RLinf 的通用性也已在数学推理等跨领域任务中验证,取得 AIME24/25 和 GPQA-diamond 等基准的 SOTA 表现。
本次演讲我将分享 RLinf 的设计理念与关键创新,并分享其在具身智能与跨领域应用中的系统级成果。
演讲提纲
1. 背景与趋势
• 从感知到行动:具身智能成为 AI 新前沿
• o1/R1 引领范式转变:奖励驱动的 RL 取代纯数据驱动
• RL 基础设施的重要性与现有框架的不足
2. 具身智能的独特挑战
• 模型异质性:大脑(推理)+ 小脑(执行)+ 复合架构
• 渲训推一体化:仿真、渲染与训练/推理并行,资源冲突严重
3. RLinf 框架设计与创新
• 混合执行模式:流水化无“气泡”,>120% 加速
• 多后端集成:VLM 用 Megatron+SGLang,VLA 用 FSDP+HF
• 动态通信与调度:负载均衡,自动扩缩容
4. 应用实践
• 具身智能:覆盖百余类任务,VLA 提升 40–60%
• 跨领域:数学推理模型在 AIME、GPQA 基准上达到 SOTA
5. 总结与展望
• RL 正在重塑大模型训练
• RLinf = 高效、省力、可扩展的具身智能 RL 基础设施
• 助力科研与产业走向下一代通用智能
实践痛点
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

