多模态融合技术正在重塑AI发展范式,它不仅是实现通用人工智能(AGI)的核心突破... 展开 >




浙江大学计算机硕士,网易云信音视频技术负责人。先后参与了网易 UU 网游加速器、易信、云信等重大项目开发和技术管理工作。目前全面负责网易云信实时音视频与 AI 引擎、WE-CAN 全球智能传输网络、AI 数字人、实时对话式 AI 智能体、智能硬件等方向的架构设计与技术演进。在音视频流媒体、人工智能、大语言模型及多模态技术与流媒体融合等领域均有多年实战经验。
多模态融合技术正在重塑AI发展范式,它不仅是实现通用人工智能(AGI)的核心突破口,更推动着人机交互体验的范式变革。通过深度融合文本、图像、音频、视频等多维数据,现代 AI 系统正在突破单模态的认知局限,构建起更接近人类的多维感知与理解能力。这种变革不仅大幅提升了 AI 的认知水平,更催生了前所未有的应用场景和创新机遇。
本专题将聚焦四大关键维度,重点讨论:
专题受众
技术实施团队
参会收益
本专题将通过技术剖析、案例解构、行业话场景实践,为参会者提供企业如何将大模型从技术认知到商业落地的完整价值闭环。
The next wave of AI combines language, behavior, and embodiment into a single interface with voice, personality, and presence. As AI evolves beyond text generation toward emotionally responsive, multimodal systems, Visual Conversational AI is poised to redefine how we work, learn, and engage. This session explores the underlying technologies such as real-time behaviour modelling that power lifelike avatars, and how they enable a shift from static conversational bots to fully interactive digital beings capable of speaking and listening in a lifelike manner.
人工智能的下一波浪潮将语言、行为和具身化整合到一个集声音、个性与存在感于一体的界面中。随着人工智能从文本生成向具备情感响应能力的多模态系统演进,视觉对话式人工智能正蓄势待发,重新定义我们的工作、学习与互动方式。本环节将深入探讨支撑逼真虚拟形象的底层技术(如实时行为建模),以及这些技术如何推动人工智能从静态对话机器人向能够以逼真方式进行听说互动的全交互式数字 “生命体” 转变。
Presentation Outline
1. The Next Wave of AI — From Text to Multimodal Interaction
2. Core Technologies Behind Lifelike Avatars
3. The Power of Embodiment — Voice, Personality, and Presence
4. Emotional Responsiveness in AI
5. Use Cases Transforming Work, Learning & Engagement
6. The Trust Factor — Why Lifelike Interactions Drive Better Outcomes
7. Challenges & Considerations — Latency, Realism, Technical Expertise
8. The Future is Interactive — A Vision for Visual Conversational AI
演讲提纲
1. 人工智能的下一波浪潮 —— 从文本到多模态交互
2. 逼真虚拟形象背后的核心技术
实时行为建模
语音合成与情感韵律
面部动画与肢体动作
3. 具身化的力量 —— 声音、个性与存在感
4. 人工智能中的情感响应能力
5. 改变工作、学习与参与方式的应用案例
6. 信任因素 —— 为何逼真交互能带来更好的结果
7. 挑战与考量 —— 延迟、真实感、技术专业性
8. 未来是交互式的 —— 视觉对话式人工智能的愿景
演讲亮点
听众收益
在多模态大模型迅猛发展的浪潮中,面向 Mobile、PC、车机等多端场景构建具备自动化操作能力的智能体,已成为当前产学界聚焦的前沿方向。我们以多智能体协同架构为起点(Mobile-Agent v1/v2/-e),逐步演进至统一的 GUI 基础 Agent 模型(Mobile-Agent-v3),系统性地构建起覆盖多模态、多端交互的 Mobile-Agent 技术体系。该系列工作凭借卓越的创新性与应用价值,连续两年荣获 CCL2024 与 CCL2025 最佳演示奖,推动端侧智能迈向感知-决策-执行一体化的新阶段。
本次演讲我将系统介绍 Mobile-Agent 系列技术的演进路线与核心创新,涵盖多智能体协同控制、视觉语言理解与动作执行等关键突破,并通过实际案例展示其在多端设备上的自动化能力。听众可全面了解如何构建高效、实用的 GUI 智能体,并洞察端侧智能 Agent 的未来发展趋势。
演讲提纲
1. 大模型智能体背景
2. 多模态 GUI 智能体架构
3. 多模态 GUI 基础智能体 Mobile-Agent-v3
4. Mobile-Agent 系列开源应用
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
在智能硬件交互面临体验瓶颈的当下,网易云信通过多模态融合与认知计算技术,推动设备从“机械应答”向“情感共鸣”演进。本次分享将解析远场降噪麦克风阵列实现 8 米精准拾音、TOF 视觉模组捕捉微表情与肢体动作的多模态感知系统,以及声纹与情绪参数的实时联合输入机制;揭秘分层式用户画像库如何动态存储长期偏好与短期场景,并利用时序注意力机制保障对话连贯性;同时展示情感化响应生成模型在儿童教育机器人、智能座舱等场景的落地效果,实现从“能听会看”到“懂情绪、有记忆”的交互跃迁。听众将获得多模态感知工程化、情感化交互设计及大模型硬件适配的实战经验。
演讲提纲
1. 智能硬件市场概况
2. 网易云信对话式 AI 技术架构
3. 多模态交互技术
4. MCP 生态与开发
5. 典型案例
5. 未来展望
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

