从事 Kubernetes 和容器相关产品的开发。尤其关注利用云原生技术构建机器学习平台系统,CNCF 项目 Fluid 的联合创始人和主要维护者,也是业界第一个 GPU 共享调度的主要作者和维护者。他还是 Alluxio 开源项目的管理委员会成员(PMC Member),Kubernetes,Docker 和 Kubeflow 等社区的积极贡献者。

从事 Kubernetes 和容器相关产品的开发。尤其关注利用云原生技术构建机器学习平台系统,CNCF 项目 Fluid 的联合创始人和主要维护者,也是业界第一个 GPU 共享调度的主要作者和维护者。他还是 Alluxio 开源项目的管理委员会成员(PMC Member),Kubernetes,Docker 和 Kubeflow 等社区的积极贡献者。
人工智能生成内容(AIGC)和大型语言模型(LLM)在近一年内方兴未艾,进一步提升了大众对生成式模型的期望值。然而,正如 Gartner 报告中所提到的:“启动 AI 应用程序试点项目看起来轻而易举,但将它们部署到生产环境中则极具挑战性“。AIGC 模型推理服务相比于传统的模型,在云上的工程化落地存在许多挑战,包括如何应对模型复杂的架构和规模,计算资源需求,弹性扩缩容和模型更新等问题。而模型从存储加载到 GPU 的性能制约了弹性伸缩和模型频繁升级等核心场景。
在本次分享中,我将介绍在 Fluid 项目作为云原生AI场景下的数据和任务编排框架,在 AIGC 模型推理工程化落地方面做了许多优化探索的工作,包括简化云原生 AI 场景的分布式缓存管理和运维,降低资源成本;以及优化推理服务读取模型数据的效率,加速模型加载过程。我们也会演示如何通过 Fluid 将一个 LLM 模型的推理加载速度提升近7倍,同时提供缓存弹性的能力,避免资源浪费。
演讲提纲:
听众收益点:



微信咨询

电话咨询
微信联系我们

