高欢,快手快意多模态基座模型负责人,主要负责AI生成场景背后的多模态理解研发工作,深度参与快手多个 AIGC 算法技术落地。目前的主要研究兴趣包括:多模态大语言模型、视频理解编码器、大语言模型,曾在 NeurIPS、ACL、AAAI、ECCV、ICDE 等顶级学术会议上发表多篇论文。

高欢,快手快意多模态基座模型负责人,主要负责AI生成场景背后的多模态理解研发工作,深度参与快手多个 AIGC 算法技术落地。目前的主要研究兴趣包括:多模态大语言模型、视频理解编码器、大语言模型,曾在 NeurIPS、ACL、AAAI、ECCV、ICDE 等顶级学术会议上发表多篇论文。
本次演讲我将围绕社交短视频理解任务展开。首先介绍多模态理解技术的发展现状,讲述应用产品视角和学术定义视角的多模态理解能力,并介绍业界主流的技术方案。随后将围绕社交短视频的特点和痛点展开,介绍一套经过验证的解决方案流程。最后,将围绕两个近期的热门多模态方向进行讨论:视觉 R1 和 Benchmark 。
演讲提纲
1. 多模态技术的发展
2. 社交短视频理解的难点
3. 社交短视频理解任务的解决方案
4. 未来与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
微信联系我们

