多模态大模型及应用

会议室:中华厅2
出品人:张俊林

随着多模态大模型技术日益成熟,其在各行业的应用愈发广泛。它打破了单一数据模态的限... 展开 >

专题出品人:张俊林

新浪微博首席科学家及新技术研发负责人

张俊林,新浪微博首席科学家及新技术研发负责人,中国中文信息学会理事,中科院软件所博士,此前在阿里巴巴担任资深技术专家,负责新技术团队。技术书籍《这就是搜索引擎:核心技术详解》、《大数据日知录:架构与算法》的作者。 目前的主要研究方向为大模型及推荐系统,在ACL、KDD、CIKM、RecSys、COLING等国际会议发表多篇相关学术论文。

地点:中华厅2

专题:多模态大模型及应用

随着多模态大模型技术日益成熟,其在各行业的应用愈发广泛。它打破了单一数据模态的限制,能综合处理多源数据,可解决企业内部的数据孤岛问题,综合使用文本、图像、视频、音频等全方位数据来获得更好的业务效果,提升企业运营效率与竞争力。

本专题旨在全面介绍多模态大模型的前沿进展,包括技术突破、算法优化等。深入剖析其在不同企业的成功应用案例,总结可复制的经验与模式,为更多企业引入多模态大模型应用提供清晰的指引与借鉴。

我们期望通过深入分析, 重点探讨如下问题:

  • 多模态大模型的最新技术发展趋势有哪些?
  • 如何依据企业自身业务特点选择合适的多模态大模型应用路径?
  • 在不同行业场景下,多模态大模型如何实现与现有业务系统的无缝对接?

通过本专题,期望能让听众及时掌握多模态大模型的前沿动态,拓宽技术视野。从众多企业成功案例中汲取灵感,来为自身制定更具创新性与可行性的多模态大模型应用计划。

by 段楠

阶跃星辰
Tech Fellow

本演讲将围绕 Step-Video 系列开源模型,介绍视频生成基础模型的最新进展,包括文生视频和图生视频等任务。此外,本报告还将总结现有视频生成模型面临的主要挑战,并和大家讨论未来可能的发展发向。

演讲提纲

1. 视频生成背景和现状

  • 视频生成从简单的帧插值逐渐演变为复杂的多模态生成任务
  • 多模态融合(文本、图像、音频等)、大规模预训练模型的应用逐渐成为趋势

2. 视频生成 SoTA 模型:Step-Video

  • 技术亮点
  • 实验结果:性能对比、案例分析
  • 视频生成目前面临的挑战

3. 关于未来的讨论

  • 更强大的多模态融合
  • 实时生成

您认为,这样的技术在实践过程中有哪些痛点?

  • 高质量数据的获取、训练和推理效率、物理规律的遵循

演讲亮点

  • SoTA 模型的技术创新与架构优势
  • 系统优化与高效训练

听众收益

  • 了解该领域最新进展

by 吴侃

微博
增值业务研发中心总经理

数智化转型中,企业面临着如何平衡成本与收益的挑战。传统模式难以同时满足规模化与个性化的需求,而多模态AI技术通过综合处理文本、图像、视频等多源数据,显著提升业务效率。在此背景下,大模型能力的提升有效降低了 AI 应用的门槛,缩小了技术底层差距,使更多企业能够以较低成本实现数字化转型。关键在于如何结合自身业务优势,借助大模型技术提升现有业务效率,最大化收益。

本次演讲将结合微博及其他行业的应用案例,探讨如何利用多模态 AI 技术在数字化转型中为传统业务注入创新活力,提升企业数据的综合利用价值。我将深入分析如何平衡大模型的技术优势与实际应用中的成本与风险,确保企业在实现创新的同时获得可持续的投资回报。

演讲提纲

1. 多模态大模型技术的发展脉络与趋势

  • 从单模态的感知到跨模态的综合理解,反映了 AI 技术在认知层面的深刻变革
  • AI 正逐步实现从简单信号识别、规则到深层语义理解、意图感知和决策的本质飞跃
  • 多模态的边云结合的计算协同协作优化 

2. 多模态 AI 赋能企业数智化转型的路径与实践

  • 多模态内容理解在微博的部分应用:整合文本、图像、视频和音频等多模态数据,实现舆情监测与内容智能管理
  • 分类整理微博多模态素材,构建个人知识库以提升信息管理使用效率
  • 图像与视频分析理解图像内容与事件的“坑” 

3. 融合多模态生成式 UI 与 SaaS+AI 创新交付模式

  • 从传统的图形用户界面(GUI)与对话式界面(CUI)逐渐转向融合交互界面的发展趋势
  • 通过融合生成式 UI 快速实现与现有业务系统之间的整合,显著提升用户操作体验与业务效率
  • 建立在多个智能体实时协作与通信的基础之上的数据共享、任务分配和协作机制

您认为,这样的技术在实践过程中有哪些痛点?

  • 数智化转型时面临技术与实际业务需求脱节的问题,对于实际业务的 knowhow 不够深入,导致方案无法落地
  • 商业角度考虑大模型落地往往是投入大,收益甚微,“大炮打蚊子”
  • 商业项目和企业落地要求确定性,而大模型“幻觉”造成方案达不到预期指标

演讲亮点

  • 全新视角看待多模态大模型技术落地如何寻找场景,平衡精度与成本
  • Agent 协同融合,数据共享机制拓展应用生态

听众收益

  • 理解企业如何以多模态大模型为抓手,在规模化落地过程中有效权衡模型准确性与幻觉风险之间的实践经验与心得
  • 了解新时代交互界面的最新实践,帮助企业高效、低门槛地实现业务系统的智能化升级与融合
  • 获得企业数字化转型过程中结合自身业务特点科学规划多模态多 Agent AI 落地路径的方法论和实操经验,有效避免数据治理、成本控制等方面的常见“坑”

by 高欢

快手
多模态模型高级算法专家

本次演讲我将围绕社交短视频理解任务展开。首先介绍多模态理解技术的发展现状,讲述应用产品视角和学术定义视角的多模态理解能力,并介绍业界主流的技术方案。随后将围绕社交短视频的特点和痛点展开,介绍一套经过验证的解决方案流程。最后,将围绕两个近期的热门多模态方向进行讨论:视觉 R1 和 Benchmark 。

演讲提纲

1. 多模态技术的发展

  • 多模态技术的应用产品
  • 多模态理解任务分类:感知、认知、定位、推理
  • 模型结构:多模态特征融合、动态分辨率处理
  • 长视频理解挑战和解决方案:帧采样和 Token 丢弃

2. 社交短视频理解的难点

  • 社交短视频的特殊性
  • 社交短视频理解任务

3. 社交短视频理解任务的解决方案

  • 数据飞轮:社交短视频并不是脏数据
  • 信息堆积方案:非端到端,有利有弊
  • 视频 Token 压缩方案:内容完整性非常重要
  • 效果对比

4. 未来与展望

  • 视觉 R1,真的想好要推理什么了吗?
  • Benchmark 比比皆是,足够衡量多模态理解能力吗?

您认为,这样的技术在实践过程中有哪些痛点?

  • 忠实于内容和联想推理,在视频理解上是一对跷跷板的存在。剪辑特效类视频与自然事件类视频是影响模型偏好的两个不同方向。基于自己的业务场景,如何找到最佳的平衡点,是最重要的痛点

演讲亮点

  • 多模态技术飞速发展,“刷榜秘籍”已经漫天都是,但本次演讲不教大家如何刷榜,而会与大家交流如何从实用的角度看待多模态理解问题

听众收益

  • 交流多模态理解上更有意思和有价值的工作方向

by 李宇明

支付宝
多模态应用实验室研究员

随着多模态大模型的不断发展,生成式数字人的技术融合趋势也日益明显。通过结合视觉、语音和自然语言等多种模态数据,生成式数字人可以更加完整地呈现出真实世界中的人的行为和交流方式。这种技术融合趋势将进一步推动生成式数字人在虚拟现实、增强现实、人机交互等领域的广泛应用。

EchoMimic 是支付宝多模态应用实验室发布并开源的数字人技术项目,仅需输入一张参考图像、一段音频及一段手势序列,即可生成高质量人物动画视频,同时确保半身数字人与音频内容之间的协调。EchoMimic V1 论文中稿人工智能领域顶级国际会议 AAAI 2025,EchoMimic V2 论文中稿世界国际计算机视觉与模式识别会议 CVPR 2025。

本演讲将围绕 EchoMimic 系列开源生成式数字人项目,介绍生成式数字人领域最新进展、详细讲解 EchoMimic 背后的技术细节、以及生成式数字人相关应用场景,及该领域后续研究思路与方法。

演讲提纲

1. 传统数字人与生成式数字人技术背景

  • 传统数字人技术介绍
  • 生成式数字人技术介绍

2. EchoMimic(基于语音驱动的人像动画生成) 背后的技术

  • 技术细节与亮点
  • 实验结果分析

3. 应用场景探索

  • 生成式数字人结合大语言模型的实时交互
  • 生成式数字人结合音乐生成模型的 AI 创作
  • 生成式数字人结合商品的直播带货

4. 总结与展望

  • 生成式数字人存在的问题和挑战
  • 生成式数字人开发新范式

您认为,这样的技术在实践过程中有哪些痛点?

  • 高质量人物相关数据获取、训练和推理效率、生成数字人自然度和真实性

演讲亮点

  • 生成式数字人领域的技术路线,最新进展,以及与多模态大模型应用结合趋势
  • EchoMimic 系列生成式数字人开源项目的技术细节
  • 生成式数字人领域后续研究方向

听众收益

  • 了解生成式数字人领域最新进展
  • 了解 EchoMimic 系列生成式数字人开源项目技术细节
  • 了解生成式数字人相关应用场景,及该领域后续研究思路与方法

交通指南

北京石景山万达嘉华酒店

Wanda Jin
地址:北京市石景山区石景山路甲18号院
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手