视频已成为新时代的主流表达语言之一,本专题关注音视频体验优化的各项手段,也关注智... 展开 >




2013 年硕士毕业,一直从事计算机视觉领域研究,当前主要负责多模态 AIGC、智能编辑等技术方向。
视频已成为新时代的主流表达语言之一,本专题关注音视频体验优化的各项手段,也关注智能创作工具的建设,以及它如何为视频生态的繁荣而赋能。
多模态理解技术在过去几年历经了从练就招式,到修习心法,再到打通任督二脉的阶跃式发展。因此,多模态理解技术在业界得到了广泛的关注与争相地投入。本次 talk 中,将介绍多模态理解技术的新近发展,并介绍字节智创多模态理解与编辑团队在该方面的技术布局与进展。同时,结合字节在内容创作的旺盛需求,侧重介绍多模态理解技术赋能内容创作的应用场景。
演讲提纲:
1. 背景信息: 多模态理解技术的三重境界
2. 技术研发: 智创在多模态理解技术的布局
3. 业务应用: 多模态理解技术是创作的新动力
4. 总结
你将获得:
智能创意是大型广告平台必不可少的展示手段,也是内容生成算法的直接应用。如今,伴随着 AIGC 的大火,智能创意受到了更多的关注。本次分享旨在介绍阿里妈妈智能创意的部分技术进展,包括应用图文、直播片段、视频等各类素材制作创意的新方法,以及扩散模型为代表的 AIGC 技术的应用情况。
演讲提纲:
1. 智能创意 in 阿里妈妈
2. 全自动无模板图文创意
3. 直播高光剪辑
4. 字体迁移与新字体生成
5. 创意工具
6. 智能创意中的 AIGC 技术
你将获得:
当下AIGC 制作动画视频,要么就是炫技,要么就是粗制滥造,市面很少能用AIGC制作能够商用的动画视频。而我们利用 ChatGPT+Midjourney+Runway/Kaiber AI,采用独特的调教方法和丰富的实战经验,可快速高效地生成质量稳定的可商用的动画视频,改变传统动画和视频拍摄耗费人力的痛点,实现大幅降本增效。
演讲提纲:
1. 动画视频的 ChatGPT 的调教方法
2. Midjourney 批量制作动画的关键帧
3. Runway 对 ChatGPT 和 Midjourney 的素材快速生成视频
你将获得:
AI 的发展为多媒体技术体系提供了越来越多的可能性。传统多媒体在提升音视频转码、存储、分发等基础服务质量上的应用已经相当成熟,在此基础上结合前沿 AI 算法我们能够进一步提升用户观感体验,并促进创作者权益保障体系的完善。 从用户体验的角度出发,我们建立了一套非常完整的覆盖云 / 边 / 端、点 / 直播的画质增强链路;利用大语言模型提升用户对信息流的汲取效率。 从 UP 主权益的角度出发,我们在不断尝试通过技术手段为 UP 主拓展更多的收入增长模式;在版权意识崛起的今天更好的保障 UP 主的创作成果。
演讲提纲:
1. 全链路视频画质质量监测与提升
2. 基于 LLM 的视频拆条应用落地
3. 虚拟广告植入的技术探索
4. 面向规模化的AI视频数字水印系统
你将获得:
1. B站多媒体实验室的研发热点
2. 前沿技术落地的经验与思考



微信咨询

电话咨询
领取往期热门演讲视频

