专题演讲嘉宾:隋伟 博士

地瓜机器人算法副总裁

隋伟博士,现任地瓜机器人算法技术副总裁。

2011 年,他于北京航空航天大学探测制导与控制技术专业毕业,之后进入中科院自动化研究所深造,并取得博士学位,其研究方向为模式识别与智能系统。

2016 年 7 月博士毕业后,担任模式识别国家重点实验室助理研究员,负责 3D 视觉感知方向的研发工作。

2019 年 1 月隋伟博士加入地平线,任高级算法工程师,主要负责机器人和自动驾驶场景下,基于旭日和征程系列芯片的 2.5D 及 3D 视觉算法研发。2020 年 12 月- 2023 年 12 月,任研发总监,带领团队(30人)成功开发了地平线高阶自动驾驶 BEV 感知方案,并且搭建了国内首套最为完备且先进的 4D Label 标注系统。目前旭日系列芯片出货量已达数百万片,BEV 感知方案也已在多个车型上定点量产,为自动驾驶领域的发展做出了重要贡献。隋伟博士在 ICRA、IROS、CVPR、TIP、TVCG 等国内外知名期刊和会议上先后发表学术论文 20 余篇,拥有专利 40 多项。此外,他长期担任 ICRA、IROS 等机器人会议的审稿人,同时担任《智能驾驶和机器视觉》《智能驾驶与多维重建》等自动驾驶相关著作的主编。

2023 年 11 月至今任地瓜机器人(地平线全资子公司)算法 & 技术VP ,负责面向消费机器人和具身智能的软件算法方案研发。

 

by 隋伟 博士

地瓜机器人
算法副总裁

传统的具身智能操作方法将视觉感知、语言理解和动作规划分割为独立模块,导致系统复杂、误差易累积且泛化能力不足。视觉语言动作模型(VLA)则实现了从多模态感知到动作生成的端到端学习,构建了 “所见即所动” 的智能决策闭环,极大地推动了具身智能发展。​

然而视觉语言动作模型本身也存在诸多挑战,例如训练数据难以获取、模型结构缺少长时序和物理逻辑推理的能力。这意味着 VLA 虽然能实现一些操作功能但是对不同场景、不同任务的泛化性仍然存在挑战,无法满足实际的需求。

本次演讲主要分享 VLA 技术的基本原理和机制,以及在落地过程中涉及到的数据、评测等问题, 从而提升 VLA 的性能和易用性。

演讲提纲

1. 具身智能 VLA 的现状及挑战

  • VLA 是什么,用来解决什么问题及 VLA 的业界发展现状
  • 分层式 VLA 和端到端 VLA 的路线
  • VLA 的挑战:模型场景泛化性、任务泛化性和本体泛化性弱,VLA 模型数据获取困难,对算力要求大

2. 分层式 VLA 架构

  • 模型架构
  • 分模块功能及原理

3. VLA 的数据方案

  • 仿真数据的获取方式
  • 遥操采集及数据预处理

4. VLA 的量化部署

  • 模型优化
  • 模型量化

您认为,这样的技术在实践过程中有哪些痛点?

  • 如何设计合理的、符合需求的 VLA 模型,让模型具备一定的泛化和迁移能力
  • 如何获取高质量的 VLA 数据
  • VLA 在边缘侧的高效运行

演讲亮点

  • 从实用的角度,详细介绍 VLA 的技术原理,和影响性能的关键因素
  • 对 VLA 中常用的仿真和真机采集两条数据路线进行详细的分析
  • 详细介绍 VLA 对端侧算力的需求以及部署的工程实践

听众收益

  • 系统了解具身智能领域中 VLA 技术的现状、挑战和发展趋势
  • 理解 VLA 的模型技术架构,各个模块的作用
  • 理解仿真数据和真机数据的区别和作用
  • 获得开发 VLA 的实践思路和工程经验,包括模型设计、数据获取和量化部署

交通指南

上海浦东滨江喜来登酒店

SHERATON SHANGHAI PUDONG RIVERSIDE
地址:上海浦东大道2288号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手