专题演讲嘉宾:陈磊

小红书中台技术部技术专家

硕士毕业于北京航空航天大学信息工程专业,长期从事机器学习系统及云计算平台研发工作,目前是小红书模型推理优化加速团队技术负责人。

by 陈磊

小红书
中台技术部技术专家

自 ChatGPT 发布以来,大语言模型(LLM)以其令人惊艳的推断和生成能力震惊了世界,强人工智能时代的到来近在眼前。由于 LLM 巨大的参数量与计算任务,在满足线上服务延迟和吞吐要求方面面临较大的技术挑战,以 GPT-175B模型为例,它拥有1750亿参数,如果采用半精度(float16)存储的话至少需要320GB的存储空间。再考虑到 kv-cache 等其他存储需要,部署该模型进行推理至少需要5~6个A100GPU(每卡80GB显存)。巨大的存储与计算代价是横在 LLM 模型落地面前的一大难题。

面对这些问题与挑战,我们团队从模型压缩、算子加速以及分布式推理框架等多个方向上齐头并进,实现对 LLM 模型线上推理的综合提速, 我们在多款 LLM 上已取得了业界一流水平的推理性能。

本场演讲将从模型压缩、算子加速以及分布式推理框架研发等多方面介绍小红书在 LLM 模型推理优化问题上的一些最佳实践。

演讲提纲:

  1. 模型压缩
    • weight 量化
    • kv-cache 量化
    • weight & activation 量化
  2. 推理框架
    • continuous batch inference
    • paged attention
  3. 算子加速

听众收益点:

  • 了解到 LLM 模型服务在实际业务部署过程中所面临的问题与挑战;
  • 多种 LLM 量化压缩算法在实际业务模型上的实现与改进;
  • LLM 持续批量推理等功能的开发与落地调整;
  • 共同探讨与展望未来可能的改进方向;

交通指南

上海中优城市万豪酒店

Shanghai Marriott Hotel Pudong South
地址:上海市浦东新区沪南公路7688弄上海中优城市广场1号楼1楼
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小姐姐