在多模态大模型迅猛发展的浪潮中,面向 Mobile、PC、车机等多端场景构建具备自动化操作能力的智能体,已成为当前产学界聚焦的前沿方向。我们以多智能体协同架构为起点(Mobile-Agent v1/v2/-e),逐步演进至统一的 GUI 基础 Agent 模型(Mobile-Agent-v3),系统性地构建起覆盖多模态、多端交互的 Mobile-Agent 技术体系。该系列工作凭借卓越的创新性与应用价值,连续两年荣获 CCL2024 与 CCL2025 最佳演示奖,推动端侧智能迈向感知-决策-执行一体化的新阶段。
本次演讲我将系统介绍 Mobile-Agent 系列技术的演进路线与核心创新,涵盖多智能体协同控制、视觉语言理解与动作执行等关键突破,并通过实际案例展示其在多端设备上的自动化能力。听众可全面了解如何构建高效、实用的 GUI 智能体,并洞察端侧智能 Agent 的未来发展趋势。
演讲提纲
1. 大模型智能体背景
2. 多模态 GUI 智能体架构
- 多模态单智能体 Mobile-Agent-v1
- 多模态多智能体 Mobile-Agent-v2
- 多模态自主进化智能体 Mobile-Agent-E
- 多模态 PC 智能体 PC-Agent
3. 多模态 GUI 基础智能体 Mobile-Agent-v3
- 多模态 GUI 基础 Agent 模型 GUI-Owl
- 多模态 GUI 基础智能体 Mobile-Agent-v3
4. Mobile-Agent 系列开源应用
您认为,这样的技术在实践过程中有哪些痛点?
- Environment 成功轨迹数据获取难度大
- 真实在线的 Environment 变化比较大
演讲亮点
- Mobile-Agent 系列工作,包括 GUI 基础模型、Agent 框架、支持多种设备、Environment RL,能够体系化解决 GUI 研究应用问题,并且全系列工作都已开源
听众收益
- 能够全面了解 GUI 智能体的发展
- 能够全面了解 Mobile-Agent 系列工作