多模态融合技术与创新应用

会议室:台州宴会厅 1
出品人:吴桐

多模态融合技术正在重塑AI发展范式,它不仅是实现通用人工智能(AGI)的核心突破... 展开 >

专题出品人:吴桐

网易云信音视频技术负责人,流媒体首席架构师

浙江大学计算机硕士,网易云信音视频技术负责人。先后参与了网易 UU 网游加速器、易信、云信等重大项目开发和技术管理工作。目前全面负责网易云信实时音视频与 AI 引擎、WE-CAN 全球智能传输网络、AI 数字人、实时对话式 AI 智能体、智能硬件等方向的架构设计与技术演进。在音视频流媒体、人工智能、大语言模型及多模态技术与流媒体融合等领域均有多年实战经验。

地点:台州宴会厅 1

专题:多模态融合技术与创新应用

多模态融合技术正在重塑AI发展范式,它不仅是实现通用人工智能(AGI)的核心突破口,更推动着人机交互体验的范式变革。通过深度融合文本、图像、音频、视频等多维数据,现代 AI 系统正在突破单模态的认知局限,构建起更接近人类的多维感知与理解能力。这种变革不仅大幅提升了 AI 的认知水平,更催生了前所未有的应用场景和创新机遇。

本专题将聚焦四大关键维度,重点讨论:

  • 如何构建统一的语义空间实现模态间深度理解
  • 面向实时场景的多模态信息融合技术演进
  • 大模型与企业系统的无缝集成实践
  • 从实验室到生产环境的技术落地路径

专题受众

  • 技术决策者与管理者
    • CTO/技术副总裁
    • AI实验室负责人
    • 数字化转型负责人
    • 研发中心总监
  • 技术实施团队

    • AI 算法工程师
    • 大数据架构师
    • 系统集成专家

参会收益

  • 掌握多模态技术从研发到部署的全生命周期方法论
  • 获取头部企业的一线实践案例与架构设计经验
  • 前瞻性洞察多模态技术向 AGI 演进的技术路线

本专题将通过技术剖析、案例解构、行业话场景实践,为参会者提供企业如何将大模型从技术认知到商业落地的完整价值闭环。

by Gregor Hofer 博士

Rapport and Speech Graphics
联合创始人 & CEO

The next wave of AI combines language, behavior, and embodiment into a single interface with voice, personality, and presence. As AI evolves beyond text generation toward emotionally responsive, multimodal systems, Visual Conversational AI is poised to redefine how we work, learn, and engage. This session explores the underlying technologies such as real-time behaviour modelling that power lifelike avatars, and how they enable a shift from static conversational bots to fully interactive digital beings capable of speaking and listening in a lifelike manner.

人工智能的下一波浪潮将语言、行为和具身化整合到一个集声音、个性与存在感于一体的界面中。随着人工智能从文本生成向具备情感响应能力的多模态系统演进,视觉对话式人工智能正蓄势待发,重新定义我们的工作、学习与互动方式。本环节将深入探讨支撑逼真虚拟形象的底层技术(如实时行为建模),以及这些技术如何推动人工智能从静态对话机器人向能够以逼真方式进行听说互动的全交互式数字 “生命体” 转变。

Presentation Outline

1. The Next Wave of AI — From Text to Multimodal Interaction

  • Why Visual Conversational AI Matters Now
  • From Bots to Beings — A Shift in Human–AI Interaction

2. Core Technologies Behind Lifelike Avatars

  • Real-time behaviour modelling
  • Speech synthesis & emotional prosody
  • Facial animation & physical motion

3. The Power of Embodiment — Voice, Personality, and Presence

4. Emotional Responsiveness in AI

5. Use Cases Transforming Work, Learning & Engagement

6. The Trust Factor — Why Lifelike Interactions Drive Better Outcomes

7. Challenges & Considerations — Latency, Realism, Technical Expertise

8. The Future is Interactive — A Vision for Visual Conversational AI

演讲提纲

1. 人工智能的下一波浪潮 —— 从文本到多模态交互

  • 为何视觉对话式人工智能如今至关重要
  • 从机器人到 “生命体”—— 人机交互的转变

2. 逼真虚拟形象背后的核心技术

  • 实时行为建模

  • 语音合成与情感韵律

  • 面部动画与肢体动作

 

3. 具身化的力量 —— 声音、个性与存在感

4. 人工智能中的情感响应能力

5. 改变工作、学习与参与方式的应用案例

6. 信任因素 —— 为何逼真交互能带来更好的结果

7. 挑战与考量 —— 延迟、真实感、技术专业性

8. 未来是交互式的 —— 视觉对话式人工智能的愿景

演讲亮点

  • AI 正从文本交互迈向融合语音、表情等的多模态交互,技术让虚拟形象更逼真,改变人机互动模式。
  • 视觉对话式 AI 在工作、学习等场景作用显著,能通过情感响应和个性展现提升信任与效果。
  • AI 未来前景广阔,如何解决延迟、真实感及技术门槛等挑战。

听众收益

  • 能了解 AI 从文本交互到多模态交互的发展趋势,以及让虚拟形象更逼真的核心技术。
  • 可掌握视觉对话式 AI 在工作、学习等场景的实际应用价值,以及它如何提升交互效果。
  • 能清晰了解视觉 AI 的未来前景和当前面临的挑战,并对它的发展有更全面的认知。

by 徐海洋

阿里巴巴
通义实验室高级算法专家

在多模态大模型迅猛发展的浪潮中,面向 Mobile、PC、车机等多端场景构建具备自动化操作能力的智能体,已成为当前产学界聚焦的前沿方向。我们以多智能体协同架构为起点(Mobile-Agent v1/v2/-e),逐步演进至统一的 GUI 基础 Agent 模型(Mobile-Agent-v3),系统性地构建起覆盖多模态、多端交互的 Mobile-Agent 技术体系。该系列工作凭借卓越的创新性与应用价值,连续两年荣获 CCL2024 与 CCL2025 最佳演示奖,推动端侧智能迈向感知-决策-执行一体化的新阶段。

本次演讲我将系统介绍 Mobile-Agent 系列技术的演进路线与核心创新,涵盖多智能体协同控制、视觉语言理解与动作执行等关键突破,并通过实际案例展示其在多端设备上的自动化能力。听众可全面了解如何构建高效、实用的 GUI 智能体,并洞察端侧智能 Agent 的未来发展趋势。

演讲提纲

1. 大模型智能体背景

2. 多模态 GUI 智能体架构

  • 多模态单智能体 Mobile-Agent-v1
  • 多模态多智能体 Mobile-Agent-v2
  • 多模态自主进化智能体 Mobile-Agent-E
  • 多模态 PC 智能体 PC-Agent

3. 多模态 GUI 基础智能体 Mobile-Agent-v3

  • 多模态 GUI 基础 Agent 模型 GUI-Owl
  • 多模态 GUI 基础智能体 Mobile-Agent-v3

4. Mobile-Agent 系列开源应用

您认为,这样的技术在实践过程中有哪些痛点?

  • Environment 成功轨迹数据获取难度大
  • 真实在线的 Environment 变化比较大

演讲亮点

  • Mobile-Agent 系列工作,包括 GUI 基础模型、Agent 框架、支持多种设备、Environment RL,能够体系化解决 GUI 研究应用问题,并且全系列工作都已开源

听众收益

  • 能够全面了解 GUI 智能体的发展
  • 能够全面了解 Mobile-Agent 系列工作

by 陈策

网易云信
资深音视频和智能硬件开发工程师

在智能硬件交互面临体验瓶颈的当下,网易云信通过多模态融合与认知计算技术,推动设备从“机械应答”向“情感共鸣”演进。本次分享将解析远场降噪麦克风阵列实现 8 米精准拾音、TOF 视觉模组捕捉微表情与肢体动作的多模态感知系统,以及声纹与情绪参数的实时联合输入机制;揭秘分层式用户画像库如何动态存储长期偏好与短期场景,并利用时序注意力机制保障对话连贯性;同时展示情感化响应生成模型在儿童教育机器人、智能座舱等场景的落地效果,实现从“能听会看”到“懂情绪、有记忆”的交互跃迁。听众将获得多模态感知工程化、情感化交互设计及大模型硬件适配的实战经验。

演讲提纲

1. 智能硬件市场概况

  • 市场规模与需求:全球出货量及家居、穿戴等细分领域占比,用户需求
  • 技术现状与痛点:交互碎片化、记忆缺失、情感响应同质化

2. 网易云信对话式 AI 技术架构

  • 核心技术架构
  • RTC 实时传输:低延迟,弱网自适应
  • "LLM+ASR+TTS" 三段式:高精准语音处理与多情感音色
  • LLM real-time 混合模式:平衡响应速度与理解深度

3. 多模态交互技术

  • 记忆系统、归纳遗忘、人格定制
  • 多模态交互增强:声纹锁定、轮次判断、智能打断、云端 AEC
  • 情感与内容理解:语音识别与视觉识别-辅助情感理解

4. MCP 生态与开发

  • MCP 生态架构:标准化接口与 SDK/API,可视化工具链
  • 开发难点解决:轻量化模型适配低算力设备与数据安全合规

5. 典型案例

  • 陪伴场景:玩具的个性化服务与情感响应
  • 教育场景:学习设备的个性化辅导
  • 养老场景:陪伴机器人的状态判断与关怀

5. 未来展望

  • 持续优化多模态交互效率
  • 完善 MCP 开发生态
  • 垂直场景深度适配

演讲亮点

  • 全链路技术突破:解析弱网环境下 RTC 传输延迟控制及远场降噪方案,解决智能硬件交互稳定性问题。
  • 混合式 LLM 架构揭秘:详解终端轻量化模型与云端大模型的实时协同机制,平衡响应速度与上下文处理能力,破解算力受限设备的 AI 推理难题。
  • 情感交互技术栈拆解:剖析融合语音与文本特征的情绪识别系统及多维度情感调制的 TTS 引擎,展示智能硬件情感化的实现路径。
  • 低算力适配方案:分享模型压缩与功耗优化经验,以及对低端架构的移植技术,如何实现轻量化落地。
  • 技术开放路线图:下一代端云协同技术进展,预告轻量化模型开源计划,为开发者提供明确接入方向。

听众收益

  • 了解智能硬件行业的现状
  • 了解智能硬件的开发门槛
  • 了解目前尖端的对话式 AI 技术细节

交通指南

上海浦东滨江喜来登酒店

SHERATON SHANGHAI PUDONG RIVERSIDE
地址:上海浦东大道2288号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手