多模态大模型技术迅猛发展,以视觉-语言大模型(VLA/VA)为代表的离身智能已实... 展开 >





2011 年,他于北京航空航天大学探测制导与控制技术专业毕业,之后进入中科院自动化研究所深造,并取得博士学位,其研究方向为模式识别与智能系统。
2016 年 7 月博士毕业后,担任模式识别国家重点实验室助理研究员,负责 3D 视觉感知方向的研发工作。
2019 年 1 月隋伟博士加入地平线,任高级算法工程师,主要负责机器人和自动驾驶场景下,基于旭日和征程系列芯片的 2.5D 及 3D 视觉算法研发。2020 年 12 月- 2023 年 12 月,任研发总监,带领团队(30人)成功开发了地平线高阶自动驾驶 BEV 感知方案,并且搭建了国内首套最为完备且先进的 4D Label 标注系统。目前旭日系列芯片出货量已达数百万片,BEV 感知方案也已在多个车型上定点量产,为自动驾驶领域的发展做出了重要贡献。隋伟博士在 ICRA、IROS、CVPR、TIP、TVCG 等国内外知名期刊和会议上先后发表学术论文 20 余篇,拥有专利 40 多项。此外,他长期担任 ICRA、IROS 等机器人会议的审稿人,同时担任《智能驾驶和机器视觉》《智能驾驶与多维重建》等自动驾驶相关著作的主编。
2023 年 11 月至今任地瓜机器人算法 VP ,负责面向消费机器人和具身智能的软件算法方案研发。
多模态大模型技术迅猛发展,以视觉-语言大模型(VLA/VA)为代表的离身智能已实现初步通用化与泛化能力,在数字领域构建起成熟应用基础。具身智能作为AI从数字世界迈向物理现实的核心跃迁,成为通往通用人工智能(AGI)的关键路径,却受限于模型泛化性、数据采集与闭环等难题,技术落地受阻。本专题聚焦 VLA/VA 模型与数据体系两大核心,深度拆解具身智能技术链路。拟探讨模型现状、核心挑战与机会,分享高质量数据解决方案,解析仿真与 World Model 的赋能价值,破解核心技术瓶颈。旨在搭建顶尖交流平台,助力从业者与研究者明晰方向,加速具身智能技术研发转化与产业规模化落地。
专题受众
本专题精准覆盖具身智能领域全产业链从业者与研究者,具体包括:
在工业领域,机器人主要依靠示教编程执行高重复性、低复杂度的任务。然而,随着全球制造业向“柔性化”和“高度自动化”转型,企业面临着更多非结构化环境下的精密操作需求。
具身智能经历了3年的发展,2026 到了比拼落地的深水区,我们需要用一个务实且有前瞻性的思考指引未来的方案设计。当前的痛点在于:传统方案难以应对多变的操作目标,而全栈的大模型(VLA)在工业环境的低延迟和高精度要求下仍显沉重。本次演讲我将聚焦于如何通过 VA (Vision-Action) 架构,结合传统自动化与现代深度学习,构建一套可落地的工业级机器人操控方案。
演讲提纲
1. 工业操控问题的分类和定义
2. 硬件架构选型:从本体到末端执行器
3. 算法方案深度解析:传统与 AI 的融合
4. 高质量数据闭环:方案落地的基石
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
本专题围绕 “具身智能与物理世界交互” 核心方向,聚焦智能 Agent 如何衔接视觉 - 语言大模型(VLA/VA)与真实物理场景。在多模态大模型具备强泛化能力的基础上,探讨具身 Agent 如何实现感知、决策、规划与执行的全闭环,打通从数字智能到物理交互的关键链路。内容将解析模型泛化、数据体系、仿真与世界模型等核心瓶颈,分享面向真实场景的 Agent 架构设计与高质量数据方案,为具身智能技术突破、产品化落地与产业规模化提供清晰路径与实战思路。
演讲提纲
1. 背景:多模态大模型(VLA/VA)的离身智能成果与局限
2. 技术拆解:具身 Agent 的核心技术链路
3. 关键瓶颈与突破路径
4. 实践分享:具身 Agent 落地案例与经验
5. 未来展望与互动交流
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
具身智能在高价值工业场景落地,核心挑战在于处理人、机、料、法、环带来的系统性复杂度。单点作业速度的提升往往难以转化为全链路的提效,必须综合考量节拍对齐与运维成本。
本次分享我将介绍我们在工业具身场景的落地实践,探讨长上下文理解与推理速度的工程平衡策略,分享在现场落地过程中遇到的现场硬件失效、传感器干扰等问题。目前,在特定高价值场景下,具身系统的综合成本已趋近人力成本临界点,结合高技能工人缺口现状,为规模化落地提供了支撑。
演讲提纲
1. 真实场景落地逻辑:算法之外的工程考量
2. VA 路线在垂直行业的落地
3. 现场实际案例
4. 高价值场景的具身落地机会
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
空间智能旨在让机器理解、生成与利用三维空间中的结构、物体与物理属性,是数字孪生、具身智能与自动驾驶等应用的基础。若仅依赖人工建模或单一数据源,难以在规模与真实性上同时满足“可仿真、可交互”的需求。我们期望实现的完备空间智能,应包含对空间结构、物体、关系及物理属性(几何、材质等)的完整刻画与利用方式。空间智能与 3D/4D 世界模型一脉相承,其在内容创作、智驾仿真与具身智能等方面具有广阔前景;我们围绕完备空间智能应包含的信息与利用方式,从生成与重建两条路径进行了探索:生成方法面向大规模、大尺度的泛化以及场景数量级的扩充,通过程序化内容生成(PCG)与 Agent 从语义/图像出发批量搭建场景;重建方法则面向对现实世界的精细复刻,将真实场景抽象为具备几何与材质物理属性的数字孪生。两条路线应对的应用场景不同,但都旨在得到完备的空间智能数据表现形式,为仿真与决策提供可靠环境。本次演讲将围绕“什么是空间智能、如何构建、完备空间智能应包含哪些知识与信息利用方式”展开,重点分享在生成与重建两条路径上的技术选型、代表性工作与实践中的经验与局限。
演讲提纲
1. 空间智能:定义、目标与两条技术路线
2. 生成方法:从语义/图像到可交互场景
3. 重建方法:从真实世界到可仿真的数字孪生
4. 实践过程与经验未来发展前景
5. 未来发展前景
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

