端侧大模型的创新与应用

会议室:台州宴会厅 3
出品人:朱世艾 博士

随着大模型技术的发展进入深水区,AI 应用的体验、成本、与隐私性正在成为愈来愈关... 展开 >

专题出品人:朱世艾 博士

蚂蚁集团xNN 引擎负责人,支付宝多模态应用实验室研究员

2013 年获得香港城市大学博士学位,之后前往加拿大渥太华大学从事博士后研究,2016 年加入蚂蚁集团,具有十多年算法研发和性能优化经验。在蚂蚁期间,先后担任过新春五福、扫一扫、会员等支付宝多个业务的算法负责人,开发了几乎覆盖所有 CV 类任务的超轻量移动端 AI 算法组件。自 2023 年开始担任支付宝移动端研发框架 xNN 的负责人,主导了面向超级 APP 的端侧大模型技术体系建设,致力于在大模型时代推动端侧 AI 技术的产业应用。

地点:台州宴会厅 3

专题:端侧大模型的创新与应用

随着大模型技术的发展进入深水区,AI 应用的体验、成本、与隐私性正在成为愈来愈关键的命题。大模型若能直接在终端侧部署,在优化体验、节省云服务成本、以及保护数据隐私等方面,对产业应用毫无疑问有着巨大的吸引力。然而,庞大的模型尺寸与计算复杂度,使得端大模型的落地困难重重。随着从基模到硬件厂商全产业链的投入,适合端上运行的 1B ~ 3B 大模型能力不断得到提升,终端芯片的演进和系统应用层对于大模型推理的深度优化,使得端侧大模型产业应用得以实现。

本专题将聚焦端侧大模型关键技术,讨论如下方面问题:

  • 端侧大模型轻量化关键技术
  • 异构环境下大参数量模型推理优化技术
  • 端侧大模型应用实践案例和用户价值
  • 端侧大模型的未来趋势

专题受众

终端应用开发、大模型研发、高性能计算、芯片设计

通过本专题,听众能够从不同的视角了解到大模型时代下端侧 AI 技术的演进方向、应用潜力和未来发展趋势。

by 朱世艾 博士

蚂蚁集团
xNN 引擎负责人,支付宝多模态应用实验室研究员

大模型的能力结合端侧AI在体验、成本与隐私保护方面的优势,对于业务应用无疑有着巨大的吸引力。我们可喜的看到终端大模型在各个新款手机上已经有了很好的落地案例,这之中汇聚了基础模型研发、硬件支持和系统层生态的力量。支付宝 APP 作为应用层重要的一员,端侧 AI 有着广泛的使用场景,面向大模型技术的升级也是亟待解决的问题。

然而我们面临的挑战也是巨大的:

1. APP 需要兼顾不同型号和算力的手机,特别是广泛使用的中端芯片;

2. 相对系统层来说,APP 可以用到的资源相对有限,还要保证上层应用的稳定性;

3. 手机上有着非常碎片化的硬件环境,不同 Backend 的特点不同,一致性难以解决;

4. APP 应用的模型通过网络下发部署,对于模型物理尺寸有着严格要求。

本次演讲我将介绍支付宝如何在种种限制条件下以高覆盖和低资源消耗为目标,结合低比特量化和硬件加速实现,构建出了适合 APP 生态的端大模型技术 xNN-LLM。为大家展示这一技术在精度、性能和模型覆盖方面的最新进展,以及在支付宝 APP 中的潜在应用方式。

演讲提纲

1. 背景与挑战

  • 端大模型业界进展:介绍端大模型的发展历程,包括从基模,应用到芯片支持方面的进展
  • APP 端大模型面临的挑战:在 APP 场景中端 AI 处于什么位置,主要应用场景有哪些,大模型时代面临哪些变化。基于以上问题的技术判断有哪些

2. 适合于 APP 场景的低比特量化方案

  • LLM 模型量化方案:在各种条件限制下,需要综合考虑精度、模型尺寸和推理友好,从而构建出 xNN-LLM 低比特量化方案
  • 多模态大模型量化方案:介绍量化算法从 LLM 延伸到多模态场景需要做哪些调整,包括多种可选方案的尝试
  • 量化效果对比:介绍当前量化 Pipeline 在不同模型上的精度水位

3. xNN-LLM 异构推理引擎

  • 推理引擎框架设计:面向大模型推理和应用场景特点的 xNN-LLM 框架设计
  • 模型推理实现:为了提升覆盖率,如何充分发挥手机端的异构计算资源。这里介绍 xNN-LLM 在 CPU、GPU 和 NPU 上的实践经验

4. 端大模型能力有应用展望

  • 能力介绍:当下 APP 端大模型具备什么能力,能完成哪些任务
  • 应用展望:在支付宝 APP 中,可能存在的应用场景和应用形式有哪些

5. 端大模型未来展望

  • 从整个手机生态角度来看,各方在端大模型方面可能的合作和协同机制会是什么样

您认为,这样的技术在实践过程中有哪些痛点?

  • 从能力上来说,机型覆盖和能力覆盖之间的冲突
  • 从运维的角度来看,有限资源下充分的共享带来模型更新复杂度增加
  • 从场景来看,端云结合会是安全稳妥的方案,但是实现复杂度比较

演讲亮点

  • 从 APP 应用角度出发,客观务实的阐述技术方案选型、实现技巧和应用模式

听众收益

  • 具有更为广泛应用场景的 APP 上建设端大模型的思路有什么不同
  • 了解到为什么需要算法和引擎之间进行联合优化
  • 当下端大模型能力边界在哪里,未来可能往哪些方向演进

by 徐梦炜 博士

北京邮电大学副教授、博士生导师

通过本地化搭载大模型,终端设备的智能能力将获得飞跃式提升,铸造移动计算的下一个黄金时代,对学术界和产业界都是巨大的机遇。为了更好地适应这个过程中上层应用编程接口、用户交互范式、底层资源管理的重要变化,操作系统可能会被重新定义和改写。面向以大模型能力为核心的未来智能终端硬件,本次演讲我将介绍团队在大模型操作系统设计和优化方向的思考和尝试,包括 GUI/API 终端智能体构建、面向 NPU 的端侧大模型推理优化加速等。

演讲提纲

1. 背景

  • 以大模型为核心的终端硬件发展
  • 为什么需要一个新的操作系统

2. 构建大模型操作系统的主要技术挑战

  • 面向上层智能体应用的易用接口
  • 面向受限硬件资源的高效调度

3. 技术尝试

  • GUI/API 系统级智能体
  • 面向 NPU 的端侧大模型推理优化加速
  • 端侧 KV Cache 高效压缩和管理

4. 未来展望

  • 演化路径和关键节点
  • 学术研究和产业机遇

您认为,这样的技术在实践过程中有哪些痛点?

  • 具体未来大模型操作系统的发展需要结合场景、硬件形态、模型能力发展来看,本次演讲内容偏展望性质

演讲亮点

  • 较为前沿,偏算法-系统-硬件垂直整合

听众收益

  • 了解学术界对端侧大模型的前沿尝试和思考
  • 碰撞大模型操作系统相关思想火花

by 章武

华为
CANN 端侧生态技术专家

本次演讲我将围绕当前端侧大模型日益增长需求,针对华为手机端侧大模型入端技术挑战(人因、内存、存储、功耗等),重点介绍相关创新技术实践和生态开放方案,同时展望未来端云协同技术下端侧大模型能力的演进。

演讲提纲

1. 背景

  • 端侧大模型应用场景
  • 大模型入端的主要收益

2. 端侧大模型技术的主要挑战

  • 大模型应用的人因体验
  • 内存、存储、算力和功耗多重受限

3. 大模型入端技术创新实践

  • 算法创新(投机、以存代算、token 压缩复用)
  • 模型小型化(量化)
  • 推理加速优化
  • 内存极致压缩复用

4. 大模型能力开放

  • 大模型推理引擎
  • 自定义算子编程 Ascend C

5. 未来展望

  • 端云场景的协同

您认为,这样的技术在实践过程中有哪些痛点?

  • 大模型的端侧推理的内存优化和包体积优化
  • 端侧大模型场景功耗问题

演讲亮点

  • 大模型大模型推理引擎,Ascend C 自定义编程

听众收益

  • 大模型入端技术探索,端云协同,低 bit 量化

交通指南

上海浦东滨江喜来登酒店

SHERATON SHANGHAI PUDONG RIVERSIDE
地址:上海浦东大道2288号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手