专题演讲嘉宾:张家驹

红帽首席架构师兼大中华区 CTO

热衷于开源软件及开源社区,对 Linux 操作系统、分布式、存储及高可用性、虚拟化及云计算、容器及云原生、AI基础设施等多个领域有 20 余年的产品研发、架构设计及团队管理经验,曾在知名外企及国内 ICT 领导企业担任首席架构师、技术总监、中国区技术负责人等职。此外,作为独立贡献者,曾发起开源项目并在国际上成功推广。目前就职于红帽亚太 CTO 办公室,主导AI技术战略实施,并重点推进红帽产品及解决方案在垂直行业的创新应用与落地。

by 张家驹

红帽
首席架构师兼大中华区 CTO

当前,生成式 AI 正以前所未有的速度发展,其大规模部署所依赖的推理基础设施面临诸多挑战。本次演讲我将深入探讨构建高效、可扩展的 LLM 推理基础设施的关键挑战与解决方案,并以 llm-d 项目作为核心参考。我们将分析 LLM 推理中普遍存在的高延迟、资源利用率低下、KV 缓存管理和复杂分布式编排等问题,首先介绍 vLLM 作为优化单节点 LLM 推理的基础引擎,阐述其如何通过 PagedAttention、持续批处理和推测解码等技术提升性能。随后我们将重点探讨如何将这些单节点优化扩展到分布式集群环境,作为 Kubernetes 原生的平台,实现 AI 感知路由和先进编排,从而构建更高效、可扩展的 LLM 基础设施。最后,我们将总结在实践中实现高性能和成本效益的“明智路径”,并呼吁行业共同参与云原生分布式推理开放标准的建设。

演讲提纲

1. 背景 & 问题

  • LLM 推理面临的挑战
  • 高延迟、资源利用率低下、KV 缓存需求和复杂分布式编排

2. vLLM:单节点 LLM 推理优化

  • vLLM 的定位与核心优势
  • PagedAttention、持续批处理和推测解码
  • 广泛的兼容性与开源社区驱动

3. llm-d:分布式推理

  • llm-d 的 Kubernetes 原生架构
  • 基于 vLLM 的分布式优化
  • 跨平台与行业协作

4. 结论与行动呼吁

  • 规模化 LLM 推理的“明智路径”
  • 解耦推理、智能调度与 MoE 扩展

演讲亮点

  • 开源、Kubernetes 原生、高性能

听众收益

  • 了解 LLM 推理的挑战与解决方案
  • 掌握 vLLM 和 llm-d 的核心技术与优势
  • 探索在 Kubernetes 上实现大规模 GenAI 推理的实践路径

交通指南

上海浦东滨江喜来登酒店

SHERATON SHANGHAI PUDONG RIVERSIDE
地址:上海浦东大道2288号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手