目前任美团 Staff Engineer,入选北斗人才计划。研究方向聚焦多模态大模型,重点关注开创性算法设计与模型框架构建。迄今已以第一作者或通讯作者身份发表近 20 篇 CCF-A 类论文。目前工作目标是构建多模态 Omni 模型,生成理解统一的多模态模型及可交互世界模型,并致力于相关预训练,后训练的算法研究和数据治理。2024 年获上海交通大学信息与通信工程博士学位,师从熊红凯教授;2025 年获中国图像图形学会优秀博士学位论文奖。

目前任美团 Staff Engineer,入选北斗人才计划。研究方向聚焦多模态大模型,重点关注开创性算法设计与模型框架构建。迄今已以第一作者或通讯作者身份发表近 20 篇 CCF-A 类论文。目前工作目标是构建多模态 Omni 模型,生成理解统一的多模态模型及可交互世界模型,并致力于相关预训练,后训练的算法研究和数据治理。2024 年获上海交通大学信息与通信工程博士学位,师从熊红凯教授;2025 年获中国图像图形学会优秀博士学位论文奖。
本次分享聚焦“统一多模态大模型”,探讨从“理解、生成、编辑”分立的方案转向单模型统一框架。将以自回归 Decoder-only 统一模型为主线,结合 Chameleon、Show-o、Janus、BAGEL、InternVL-U、Qwen-Image 等代表性工作,梳理统一多模态模型的主流技术路线,重点介绍美团探索的 Decoder-only 架构、各模态共享 MoE、无 ViT 结构设计、生成理解联合的多阶段训练范式、生成端 RL 策略及理解端 OPD 联合后训练等在统一理解与生成模型上的技术创新,并总结工程实践中的 FSDP2 + EP 训练范式、稀疏 MoE 与硬编码 MoE 的联合优化,以及多任务多模态数据配比等典型挑战。提出的自回归 Decoder-only 统一模型在多个基准上展现出兼顾性能与效率的优势,同时实现了交错生成与理解的交互方式,达成生成与理解的共同 SOTA。
演讲提纲
这样的技术在实践过程中有哪些痛点?
统一多模态模型的核心挑战,在于不同任务之间的表示冲突与训练冲突。理解与生成共享同一模型框架,往往会带来能力相互牵制的问题;离散 token 路线虽然统一性更强,但也可能损失视觉细节与语义表达。此外,这类模型对训练 recipe 高度敏感,蒸馏设计、任务配比、分辨率策略都会直接影响最终效果。
演讲亮点
本次分享不仅梳理技术脉络,更从系统设计与工程实践的角度重新审视统一多模态模型。一方面,将系统比较 OneCAT、Janus、BAGEL、Show-o 等方法在表示、融合与生成机制上的差异;另一方面,以自回归decoder-only统一模型为案例,深入解析其架构取舍与关键优化思路,帮助听众理解统一框架背后的设计逻辑。
听众收益



微信咨询

电话咨询
微信联系我们

