硕士毕业于北京航空航天大学信息工程专业,长期从事机器学习系统及云计算平台研发工作,目前是小红书模型推理优化加速团队技术负责人。

硕士毕业于北京航空航天大学信息工程专业,长期从事机器学习系统及云计算平台研发工作,目前是小红书模型推理优化加速团队技术负责人。
自 ChatGPT 发布以来,大语言模型(LLM)以其令人惊艳的推断和生成能力震惊了世界,强人工智能时代的到来近在眼前。由于 LLM 巨大的参数量与计算任务,在满足线上服务延迟和吞吐要求方面面临较大的技术挑战,以 GPT-175B模型为例,它拥有1750亿参数,如果采用半精度(float16)存储的话至少需要320GB的存储空间。再考虑到 kv-cache 等其他存储需要,部署该模型进行推理至少需要5~6个A100GPU(每卡80GB显存)。巨大的存储与计算代价是横在 LLM 模型落地面前的一大难题。
面对这些问题与挑战,我们团队从模型压缩、算子加速以及分布式推理框架等多个方向上齐头并进,实现对 LLM 模型线上推理的综合提速, 我们在多款 LLM 上已取得了业界一流水平的推理性能。
本场演讲将从模型压缩、算子加速以及分布式推理框架研发等多方面介绍小红书在 LLM 模型推理优化问题上的一些最佳实践。
演讲提纲:
听众收益点:



微信咨询

电话咨询
微信联系我们

