具身智能 Agent:从 VLA/VA 模型到物理世界交互的落地实践

所属专题:具身智能与物理世界交互

嘉宾 : 李元庆 | 乐享科技创新业务合伙人

会议室 : 富力3+5

讲师介绍

专题演讲嘉宾:李元庆

乐享科技创新业务合伙人

现任乐享科技创新业务合伙人。前华为云,具身智能具身规划负责人、ROBO_AGENT 负责人、2024 具身智能 KEYNOTE 技术负责人,负责盘古大模型具身智能规划、Multi AGENT 执行系统、多模态大模型会战、多模态具身规划大模型等。

议题介绍

演讲:具身智能 Agent:从 VLA/VA 模型到物理世界交互的落地实践

本专题围绕 “具身智能与物理世界交互” 核心方向,聚焦智能 Agent 如何衔接视觉 - 语言大模型(VLA/VA)与真实物理场景。在多模态大模型具备强泛化能力的基础上,探讨具身 Agent 如何实现感知、决策、规划与执行的全闭环,打通从数字智能到物理交互的关键链路。内容将解析模型泛化、数据体系、仿真与世界模型等核心瓶颈,分享面向真实场景的 Agent 架构设计与高质量数据方案,为具身智能技术突破、产品化落地与产业规模化提供清晰路径与实战思路。

演讲提纲

1. 背景:多模态大模型(VLA/VA)的离身智能成果与局限

  • 核心点切入:具身智能落地的核心瓶颈(模型泛化、数据闭环、物理交互),具身 Agent 是破解瓶颈、衔接 VLA/VA 与物理世界的核心载体
  • 核心认知:具身智能 Agent 的定位与价值
    • 定义解析:具身智能 Agent 与离身智能(VLA/VA)的区别与关联——以“感知-决策-规划-执行”全闭环,实现物理世界交互
    • 核心价值:为什么 Agent 是具身智能落地的关键?(衔接 VLA/VA泛化能力、适配物理场景不确定性、实现自主交互与闭环优化)
    • 应用锚点:结合专题方向,聚焦Agent在物理交互场景中的核心作用(打破数字与物理壁垒,推动技术从实验室走向产业

2. 技术拆解:具身 Agent 的核心技术链路

  • 基础支撑:VLA/VA 模型如何赋能具身 Agent(视觉-语言理解、多模态交互能力迁移,解决“能看懂、能听懂”的问题)
  • 核心架构:具身 Agent 的全链路设计(感知层:多模态融合感知;决策层:基于 World Model 的意图预判与规划;执行层:物理交互落地;反馈层:数据闭环优化)

3. 关键瓶颈与突破路径

  • 模型泛化性——如何让 Agent 适配复杂、多变的物理场景(避免“实验室好用、现场失效”)
  • 数据体系——高质量物理交互数据的采集、标注与复用方案(破解数据稀缺、标注成本高的难题)
  • 仿真与 World Model 赋能——如何通过仿真训练提升 Agent 的物理交互能力,降低真实场景落地成本

4. 实践分享:具身 Agent 落地案例与经验

  • 典型案例:聚焦物理交互场景,分享具身 Agent 的落地实践(模型选型、数据方案、仿真应用、交互优化)
  • 实践痛点:落地过程中遇到的 Agent 设计、数据闭环、物理适配等实际问题及解决思路
  • 可复用经验:面向从业者、研究者,提供具身 Agent 研发与落地的核心方法论

5. 未来展望与互动交流

  • 未来方向:具身 Agent 的技术迭代重点(更优泛化性、更高效数据闭环、更自然的物理交互)
  • 产业价值:Agent 推动具身智能规模化落地的路径,以及对通用人工智能(AGI)的支撑作用
  • 互动答疑:针对技术瓶颈、落地实践等问题,与现场听众交流探讨

您认为,这样的技术在实践过程中有哪些痛点?

  • 大模型很强,但落到物理世界完全不好用
  • 数据极度稀缺,且无法像互联网一样快速积累
  • 世界模型(World Model)好听不好做
  • 多智能体协同、长期记忆几乎没有成熟方案

演讲亮点

  • 不空谈大模型能力,聚焦 “从 VLA/VA 到物理动作” 的可工程化 Agent 架构
  • 提出面向真实场景的轻量化 World Model 与数据闭环方案

听众收益

  • 掌握从 VLA/VA 多模态大模型到具身智能 Agent 的真实落地链路
  • 获得解决具身智能三大痛点的实战方案:泛化性、数据闭环、物理鲁棒性
  • 建立面向 AGI 方向的具身智能顶层认知与技术判断框架

交通指南

北京富力万丽酒店

Renaissance Beijing Capital Hotel
地址:北京市朝阳区东三环中路61号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手