随着 LLM 参数量的不断增加,100B 甚至 200B 或者更大规模的模型都在... 展开 >






腾讯翻译负责人,腾讯AI Lab 专家研究员,毕业于中国科学院自动化研究所,研究方向为机器翻译、自然语言处理。长期专注于交互翻译和机器翻译的研究与应用,在 ACL、AAAI、IJCAI、EMNLP 等人工智能领域顶级会议与 TASLP 等顶级期刊发表论文20余篇。
随着 LLM 参数量的不断增加,100B 甚至 200B 或者更大规模的模型都在不断出现。但在实际业务中,7B~13B 模型的大规模服务在请求延时和服务成本方面都面临巨大挑战。所以如何通过工程或者模型的方法,在不增加硬件成本的前提下降低请求延迟,同时减少高 QPS 时的资源需求,就成为非常关键的课题。
本专题会邀请一些知名公司专门从事 LLM 推理加速和大规模服务的团队分享他们在 LLM 服务方面的经验,希望能对大家的工作带来一些帮助。
Cosmos.AI 是 PayPal 公司一个端到端的 ML 服务平台,目标用户涵盖了公司内部不同业务部门(风控,合规、客户服务等)的 ML 相关人员(包括数据科学家、业务分析师、开发人员和 MLOps 工程师)。Cosmos.AI 平台专注于提供一个自助式的、可靠的、可伸缩的、高效和安全的模型构建、训练、部署和决策平台,来标准化机器学习开发的生命周期(MLDLC)。随着 GenAI 技术的不断推广和进步,我们的平台也融入了对 LLM 的支持。
本场演讲将从平台架构、技术、功能、用例等各方面介绍 Cosmos.AI 服务平台,以及其中的一些最佳实践。
演讲提纲:
听众收益点:
大模型推理服务的速度、吞吐率、成本和易用性对于大模型的商业落地至关重要。本次分享将介绍如何设计和实现一款高效的、高度可配置的、容易部署的大模型推理引擎与服务。
听众收益:
自 ChatGPT 发布以来,大语言模型(LLM)以其令人惊艳的推断和生成能力震惊了世界,强人工智能时代的到来近在眼前。由于 LLM 巨大的参数量与计算任务,在满足线上服务延迟和吞吐要求方面面临较大的技术挑战,以 GPT-175B模型为例,它拥有1750亿参数,如果采用半精度(float16)存储的话至少需要320GB的存储空间。再考虑到 kv-cache 等其他存储需要,部署该模型进行推理至少需要5~6个A100GPU(每卡80GB显存)。巨大的存储与计算代价是横在 LLM 模型落地面前的一大难题。
面对这些问题与挑战,我们团队从模型压缩、算子加速以及分布式推理框架等多个方向上齐头并进,实现对 LLM 模型线上推理的综合提速, 我们在多款 LLM 上已取得了业界一流水平的推理性能。
本场演讲将从模型压缩、算子加速以及分布式推理框架研发等多方面介绍小红书在 LLM 模型推理优化问题上的一些最佳实践。
演讲提纲:
听众收益点:
人工智能生成内容(AIGC)和大型语言模型(LLM)在近一年内方兴未艾,进一步提升了大众对生成式模型的期望值。然而,正如 Gartner 报告中所提到的:“启动 AI 应用程序试点项目看起来轻而易举,但将它们部署到生产环境中则极具挑战性“。AIGC 模型推理服务相比于传统的模型,在云上的工程化落地存在许多挑战,包括如何应对模型复杂的架构和规模,计算资源需求,弹性扩缩容和模型更新等问题。而模型从存储加载到 GPU 的性能制约了弹性伸缩和模型频繁升级等核心场景。
在本次分享中,我将介绍在 Fluid 项目作为云原生AI场景下的数据和任务编排框架,在 AIGC 模型推理工程化落地方面做了许多优化探索的工作,包括简化云原生 AI 场景的分布式缓存管理和运维,降低资源成本;以及优化推理服务读取模型数据的效率,加速模型加载过程。我们也会演示如何通过 Fluid 将一个 LLM 模型的推理加载速度提升近7倍,同时提供缓存弹性的能力,避免资源浪费。
演讲提纲:
听众收益点:



微信咨询

电话咨询
微信联系我们

