异构分布式大模型推理技术实践

所属专题:大模型基础设施与算力优化

嘉宾 : 涂小兵 | 商汤高性能计算与推理部高级总监

会议室 : 红宝石CD厅

讲师介绍

专题演讲嘉宾:涂小兵

商汤高性能计算与推理部高级总监

涂小兵,商汤大装置事业群研发部高性能计算与推理部高级总监,负责云侧芯片、端侧芯片的高性能推理计算引擎研发及训练推理侧的核心算子优化。先后就职于英特尔、英伟达、华为、阿里、快手等公司,在全栈系统优化、AI 引擎框架、大模型的推理及训练框架等领域均拥有深入的研究和实践经验。

议题介绍

演讲:异构分布式大模型推理技术实践

随着人工智能领域的发展,越来越复杂的大型语言模型正在被广泛应用于各个行业,这些模型的推理需求也随之大幅提升。鉴于国际供应链的持续不确定性,我们或将面临因依赖英伟达芯片而产生的潜在风险与挑战。为此,我们采用了英伟达和国产化芯片混合的异构分布式推理方案,该方案将充分发挥两种芯片的优势,确保系统的高效性和稳定性,同时减少对单一供应链的依赖,提升推理能力和自主控制能力。

推理优化已经不局限于算子层面,需要站在系统全局的角度分析并解决问题,需要设计者有全面的技术积累(分布式、算法、算子优化、量化),需要站在异构大集群的背景下思考问题。本次演讲将分享商汤高性能计算与推理团队自研的异构分布式大模型推理系统遇到的挑战以及实现,希望能给大家带来一些帮助和思考。

演讲提纲

1. 异构分布式大模型推理系统优化

  • 大模型推理已经演变成一项复杂的系统级别优化
  • 适配不同芯片的分布式异构推理系统
  • 模型快速加载,推理 POD 快速拉起

2. 多元算力芯片推理优化

  • 推理芯片评测选型
  • 多元算力芯片深度推理优化

3. MOE 的推理优化

  • MOE 的兴起
  • MOE 的推理优化方案
  • MOE + MLA 的优势

4. 大规模异构推理集群的未来展望

  • 更大规模的异构集群的管理调度
  • 高效的多模态融合推理

实践痛点

  • 异构芯片之间的通信交互优化
  • 如何快速的进行多元算力芯片选型

演讲亮点

  • 深入剖析多样化芯片适配优化方案
  • MOE + MLA 的深度推理优化方案

听众收益

  • 了解多元算力芯片技术发展趋势
  • 了解大模型推理系统的现状和演进方向

交通指南

上海中谷小南国花园酒店

China Grain Hotel
地址:上海市杨浦区佳木斯路777号(近营口路口)
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手