随着多模态大模型技术日益成熟,其在各行业的应用愈发广泛。它打破了单一数据模态的限... 展开 >





张俊林,新浪微博首席科学家及新技术研发负责人,中国中文信息学会理事,中科院软件所博士,此前在阿里巴巴担任资深技术专家,负责新技术团队。技术书籍《这就是搜索引擎:核心技术详解》、《大数据日知录:架构与算法》的作者。 目前的主要研究方向为大模型及推荐系统,在ACL、KDD、CIKM、RecSys、COLING等国际会议发表多篇相关学术论文。
随着多模态大模型技术日益成熟,其在各行业的应用愈发广泛。它打破了单一数据模态的限制,能综合处理多源数据,可解决企业内部的数据孤岛问题,综合使用文本、图像、视频、音频等全方位数据来获得更好的业务效果,提升企业运营效率与竞争力。
本专题旨在全面介绍多模态大模型的前沿进展,包括技术突破、算法优化等。深入剖析其在不同企业的成功应用案例,总结可复制的经验与模式,为更多企业引入多模态大模型应用提供清晰的指引与借鉴。
我们期望通过深入分析, 重点探讨如下问题:
通过本专题,期望能让听众及时掌握多模态大模型的前沿动态,拓宽技术视野。从众多企业成功案例中汲取灵感,来为自身制定更具创新性与可行性的多模态大模型应用计划。
本演讲将围绕 Step-Video 系列开源模型,介绍视频生成基础模型的最新进展,包括文生视频和图生视频等任务。此外,本报告还将总结现有视频生成模型面临的主要挑战,并和大家讨论未来可能的发展发向。
演讲提纲
1. 视频生成背景和现状
2. 视频生成 SoTA 模型:Step-Video
3. 关于未来的讨论
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
数智化转型中,企业面临着如何平衡成本与收益的挑战。传统模式难以同时满足规模化与个性化的需求,而多模态AI技术通过综合处理文本、图像、视频等多源数据,显著提升业务效率。在此背景下,大模型能力的提升有效降低了 AI 应用的门槛,缩小了技术底层差距,使更多企业能够以较低成本实现数字化转型。关键在于如何结合自身业务优势,借助大模型技术提升现有业务效率,最大化收益。
本次演讲将结合微博及其他行业的应用案例,探讨如何利用多模态 AI 技术在数字化转型中为传统业务注入创新活力,提升企业数据的综合利用价值。我将深入分析如何平衡大模型的技术优势与实际应用中的成本与风险,确保企业在实现创新的同时获得可持续的投资回报。
演讲提纲
1. 多模态大模型技术的发展脉络与趋势
2. 多模态 AI 赋能企业数智化转型的路径与实践
3. 融合多模态生成式 UI 与 SaaS+AI 创新交付模式
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
本次演讲我将围绕社交短视频理解任务展开。首先介绍多模态理解技术的发展现状,讲述应用产品视角和学术定义视角的多模态理解能力,并介绍业界主流的技术方案。随后将围绕社交短视频的特点和痛点展开,介绍一套经过验证的解决方案流程。最后,将围绕两个近期的热门多模态方向进行讨论:视觉 R1 和 Benchmark 。
演讲提纲
1. 多模态技术的发展
2. 社交短视频理解的难点
3. 社交短视频理解任务的解决方案
4. 未来与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
随着多模态大模型的不断发展,生成式数字人的技术融合趋势也日益明显。通过结合视觉、语音和自然语言等多种模态数据,生成式数字人可以更加完整地呈现出真实世界中的人的行为和交流方式。这种技术融合趋势将进一步推动生成式数字人在虚拟现实、增强现实、人机交互等领域的广泛应用。
EchoMimic 是支付宝多模态应用实验室发布并开源的数字人技术项目,仅需输入一张参考图像、一段音频及一段手势序列,即可生成高质量人物动画视频,同时确保半身数字人与音频内容之间的协调。EchoMimic V1 论文中稿人工智能领域顶级国际会议 AAAI 2025,EchoMimic V2 论文中稿世界国际计算机视觉与模式识别会议 CVPR 2025。
本演讲将围绕 EchoMimic 系列开源生成式数字人项目,介绍生成式数字人领域最新进展、详细讲解 EchoMimic 背后的技术细节、以及生成式数字人相关应用场景,及该领域后续研究思路与方法。
演讲提纲
1. 传统数字人与生成式数字人技术背景
2. EchoMimic(基于语音驱动的人像动画生成) 背后的技术
3. 应用场景探索
4. 总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

