ML模型效率与易用性

会议室:紫禁厅 2
出品人:潘欣

经历了最早期的快速发展,现阶段的 AI 工程转向关注效率和易用性。比如,针对推荐... 展开 >

专题出品人:潘欣

腾讯应用架构和机器学习平台部技术负责人

多年深度学习算法和工程经验,前 Google Brain 团队深度学习算法研究和 TensorFlow 核心开发。PaddlePaddle 深度学习框架开发负责人。目前腾讯 PCG(平台与内容事业群)的应用架构部和机器学习平台部技术负责人。

目前主要专注在腾讯 PCG 的 机器学习平台、推荐系统、容器云平台等,主要服务QQ、QQ浏览器、QQ音乐、腾讯视频、腾讯新闻等业务场景。早年参与 Google 文件系统、数据访问控制系统、谷歌云 IAM 系统设计。

地点:紫禁厅 2

专题:ML模型效率与易用性

经历了最早期的快速发展,现阶段的 AI 工程转向关注效率和易用性。比如,针对推荐系统这种最常见的 AI 系统,如何大幅降本提效?是否有新的思想可以借鉴?本专题将对此进行探讨。

by 李友科

京东
搜索与推荐平台质量保障部总监

在电商业务场景中,无论是提升用户转化率,还是帮助商家精细化运营,或是培育良性发展的生态系统,机器学习技术,特别是模型和特征的质量起着决定性的作用。而且,随着电商竞争的加剧,算法迭代效率也是出奇制胜的关键因素。为了实现持续快捷交付高质量的推理服务和高可用、极致弹性和韧性服务运行这两大目标,京东自 2019 年 12 月开始规划建设 MLOps 平台。最开始,该平台是为了解决上百个推理服务的模型推送和日常管理的问题,经过 2 年的发展,平台已经具备一站式开发、模型质量保障、快速部署接入、模型监控、生命周期管理、容量管理等功能。目前,我们还正在探索模型血缘管理、特征治理等。

它带来了许多实际的业务价值:

  • 一站式管理近千个推理服务,管理的机器规模峰值超过十万核
  • 模型交付效率提升20%
  • 服务高可用以及服务MTTR提升
  • 计算力、特征、外部资源的高效使用
  • 灵活高效应对大促峰值

演讲提纲:

1. 推理服务化与 Aaas(Algorithm as a Service)

2. 模型开发生命周期

3. Aaas 升级 MLOps

4. MLOps 带来的变革

  • 一站式开发模式
  • 质量把控从 0 到 1
  • 生命周期管理
  • 推理服务高可用
  • 效率与资源
  • 模型血缘管理

5. 新挑战:技术融合与迭代效率持续提升

你将获得:

  • 了解电商搜推场景下机器学习的一些的技术和成果
  • 开拓一些新思路,用新方法如何解决模型开发效率问题
  • 目前领域相关的挑战,以及未来的展望

by 张鑫

微软亚洲研究院
研发工程师

大规模预训练模型当前在人工智能领域扮演着重要的角色,其极大地推动了各领域的发展。而在实际部署应用中,其庞大的参数量和运算量对服务端的软硬件资源带来了极大的挑战。因此,模型压缩成为模型部署前的重要环节。由于模型压缩技术和算法的多样性且涉及模型推理延迟的编译优化,整个模型压缩的流程繁琐而复杂。本次演讲将主要介绍NNI在模型压缩上的探索与实践,通过统一的框架融合模型压缩的多种技术与方法,打通从模型压缩到模型加速的整个流程。在Transformer系列预训练模型的压缩实践中,探索出一套行之有效的压缩方法与流程,在保持高精度的同时,大幅度降低参数量与推理延迟。
 

by 王峰

Jina AI
高级算法工程师、Jina 核心贡献者

CLIP 模型作为第一个打破 NLP 和 CV 界限的模型,已广泛应用在搜索、推荐、图像生成等不同的多模态应用场景。CLIP-as-Service 是一款基于 CLIP 模型的开源软件,方便开发者快速搭建高效、易用、支持弹性伸缩的 CLIP 模型服务。在本次演讲中,王楠博士将介绍 CLIP-as-Service 的基础架构和在提高 CLIP 模型服务效率方面的经验。

演讲提纲

1. 介绍 CLIP 模型
2. 介绍 CLIP-as-Service 架构
3. 提高服务效率的经验

  • Flash Attention
  • 半精度推理
  • AITemplate
  • CUDA Graph
  • TorchDynamo

你将获得

  • 了解最新的模型推理加速工具
  • 了解最新的多模态推理服务架构设计
  • 了解 CLIP 模型

交通指南

北京·四季酒店

Beijing International Convention Center
地址:北京市朝阳区亮马桥路48号
  • 微信咨询

  • 电话咨询

    联系电话:+86 15600537884

领取往期热门演讲视频

领取往期热门演讲视频二维码
小姐姐