热衷于开源软件及开源社区,对 Linux 操作系统、分布式、存储及高可用性、虚拟化及云计算、容器及云原生、AI基础设施等多个领域有 20 余年的产品研发、架构设计及团队管理经验,曾在知名外企及国内 ICT 领导企业担任首席架构师、技术总监、中国区技术负责人等职。此外,作为独立贡献者,曾发起开源项目并在国际上成功推广。目前就职于红帽亚太 CTO 办公室,主导AI技术战略实施,并重点推进红帽产品及解决方案在垂直行业的创新应用与落地。

热衷于开源软件及开源社区,对 Linux 操作系统、分布式、存储及高可用性、虚拟化及云计算、容器及云原生、AI基础设施等多个领域有 20 余年的产品研发、架构设计及团队管理经验,曾在知名外企及国内 ICT 领导企业担任首席架构师、技术总监、中国区技术负责人等职。此外,作为独立贡献者,曾发起开源项目并在国际上成功推广。目前就职于红帽亚太 CTO 办公室,主导AI技术战略实施,并重点推进红帽产品及解决方案在垂直行业的创新应用与落地。
当前,生成式 AI 正以前所未有的速度发展,其大规模部署所依赖的推理基础设施面临诸多挑战。本次演讲我将深入探讨构建高效、可扩展的 LLM 推理基础设施的关键挑战与解决方案,并以 llm-d 项目作为核心参考。我们将分析 LLM 推理中普遍存在的高延迟、资源利用率低下、KV 缓存管理和复杂分布式编排等问题,首先介绍 vLLM 作为优化单节点 LLM 推理的基础引擎,阐述其如何通过 PagedAttention、持续批处理和推测解码等技术提升性能。随后我们将重点探讨如何将这些单节点优化扩展到分布式集群环境,作为 Kubernetes 原生的平台,实现 AI 感知路由和先进编排,从而构建更高效、可扩展的 LLM 基础设施。最后,我们将总结在实践中实现高性能和成本效益的“明智路径”,并呼吁行业共同参与云原生分布式推理开放标准的建设。
演讲提纲
1. 背景 & 问题
2. vLLM:单节点 LLM 推理优化
3. llm-d:分布式推理
4. 结论与行动呼吁
演讲亮点
听众收益



微信咨询

电话咨询
微信联系我们

