随着多模态技术的快速发展,人工智能正在从单一模态向多模态演进。近年来,以GPT-... 展开 >





严明,通义实验室文档智能技术负责人和GUI智能体Mobile-Agent负责人,主要研究方向多模态智能体、长文本理解和推理、文档智能解析和多模态文档创作等,负责打造文档智能模型产品QwenLong、Qwen-Doc,以及文档智能解析产品Document Mind,相关能力应用于千问APP、通义智文以及内外部多个产品线,并主导Mobile-Agent开源技术体系影响力建设(7k+ Stars)和创新产品孵化,在ACL、ICML、ICLR、NeuIPS、CVPR等国际会议期刊发表100多篇相关学术论文。
随着多模态技术的快速发展,人工智能正在从单一模态向多模态演进。近年来,以GPT-4o、Gemini、Sora、Nano Banana等为代表的多模态理解和生成模型的突破,标志着AI能力边界的重大跨越,相关技术也逐步在搜索、分析、设计与交互体验等各个生产力场景发挥重大作用。
本专题旨在全面介绍多模态理解与生成的前沿进展,重点关注文本、图像、音视频等多模态的统一表示、跨模态推理与生成协同,以及这些能力如何重塑搜索、分析、设计与交互体验,探索多模态如何真正进入业务流程,成为生产力的一部分,为更多企业引入多模态理解与生成应用提供清晰的指引与借鉴。
我们期望通过深入分析, 重点探讨如下问题:
通过本专题,期望能让听众及时掌握多模态理解与生成技术的前沿动态,了解其中的难点与挑战,拓宽技术视野。从众多企业成功案例中汲取灵感,来为自身制定更具创新性与可行性的多模态理解生成应用计划。
本次演讲将围绕 Qwen-Embedding 与 Qwen-VL-Embedding 系列模型,介绍向量表示与排序模型的发展脉络、关键优化技术、训练数据构造方法及典型应用场景。内容将结合文本与多模态 Embedding、Rerank 的基础背景,重点分享 Qwen 系列模型在效果优化、使用方法和实践落地中的经验,并展望 Embedding 与 Rerank 技术未来的发展方向。
演讲提纲
这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
本次分享聚焦“统一多模态大模型”,探讨从“理解、生成、编辑”分立的方案转向单模型统一框架。将以自回归 Decoder-only 统一模型为主线,结合 Chameleon、Show-o、Janus、BAGEL、InternVL-U、Qwen-Image 等代表性工作,梳理统一多模态模型的主流技术路线,重点介绍美团探索的 Decoder-only 架构、各模态共享 MoE、无 ViT 结构设计、生成理解联合的多阶段训练范式、生成端 RL 策略及理解端 OPD 联合后训练等在统一理解与生成模型上的技术创新,并总结工程实践中的 FSDP2 + EP 训练范式、稀疏 MoE 与硬编码 MoE 的联合优化,以及多任务多模态数据配比等典型挑战。提出的自回归 Decoder-only 统一模型在多个基准上展现出兼顾性能与效率的优势,同时实现了交错生成与理解的交互方式,达成生成与理解的共同 SOTA。
演讲提纲
这样的技术在实践过程中有哪些痛点?
统一多模态模型的核心挑战,在于不同任务之间的表示冲突与训练冲突。理解与生成共享同一模型框架,往往会带来能力相互牵制的问题;离散 token 路线虽然统一性更强,但也可能损失视觉细节与语义表达。此外,这类模型对训练 recipe 高度敏感,蒸馏设计、任务配比、分辨率策略都会直接影响最终效果。
演讲亮点
本次分享不仅梳理技术脉络,更从系统设计与工程实践的角度重新审视统一多模态模型。一方面,将系统比较 OneCAT、Janus、BAGEL、Show-o 等方法在表示、融合与生成机制上的差异;另一方面,以自回归decoder-only统一模型为案例,深入解析其架构取舍与关键优化思路,帮助听众理解统一框架背后的设计逻辑。
听众收益
构建一个同时具备视觉、语音、语言理解与生成能力的全模态统一模型,面临表征差异、模态失衡和训练效率三重挑战。我们提出 Ming-Flash-Omni,基于 100B 参数(6.1B 激活)的稀疏 MoE 架构,采用模态专属路由与双均衡机制在高稀疏度下实现多模态联合训练的稳定收敛;通过两阶段流水线(感知→生成)配合生成式分割范式,有效缓解理解-生成目标冲突;在基础设施层面,针对多模态数据和模型的双重异构性,设计了灵活并行策略与序列打包机制,将 MFU 从基线 7% 提升至 28%。最终模型覆盖图像/视频理解、图像生成与编辑、语音识别(含方言和上下文 ASR)、语音合成等六大方向,以仅100B-A6B模型参数在 50+ 公开 benchmark 上达到开源领先水平:视觉理解达到 Gemini 2.5 Pro ,图像生成 GenEval 0.94(SOTA),ContextASR 综合最优(Avg WER 3.30),方言识别领先同类模型 43%,多轮流式视频对话超越 Gemini 2.5 Pro。
演讲提纲
这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
目前视觉生成以扩散模型为主,我们探索了一条不同的自回归视觉生成的路线。本次演讲中,我们将以过去一年我们发表的顶会论文为基础,介绍我们在自回归视觉生成领域中的一些前沿技术探索,希望给大家科普自回归做视觉生成的方法细节、优劣势、未来发展方向。
演讲提纲
这样的技术在实践过程中有哪些痛点?
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

