专题演讲嘉宾:张文涛

焱融科技CTO

专注于分布式存储领域,拥有超过 15 年的大规模公有云存储架构开发和 AI 存储架构设计经验,主导了 YRCloudFile 高性能分布式文件存储系统从 0 到 1 的研发及落地,在 AI 及高算力场景应用落地方面实战经验丰富,对项目的整体架构设计和性能优化有深刻见解。是中国智能计算产业联盟专委会技术专家组成员、上海 TGO 鲲鹏会成员、CXL 技术应用俱乐部专家和信通院分布式存储产业方阵 DSIA 核心成员。

by 张文涛

焱融科技
CTO

2025 年年初,DeepSeek 凭借免费开源的超大语言推理模型迅速走红,掀起了全民部署大模型的热潮。随之而来,如何降低大模型使用成本成为业界关注的焦点。其中,最具吸引力的当属 KVCache “以存代算”技术。

当前,KVCache 缓存技术已成为提升大模型推理效率的行业共识。但要真正发挥其价值,关键在于扩展 KVCache 的存储缓存层以增强大模型的记忆能力,同时存储缓存层也必须具备强大的支持能力。焱融科技基于自研高性能分布式文件系统 YRCloudFile 打造了 YRCache 推理加速方案,显著提升了推理效率和模型推理性价比。

在本次演讲中,我将深入介绍焱融 YRCache 推理加速方案的技术架构和核心能力,并分享其在真实业务场景中的加速效果!

演讲提纲

1. KVCache 的技术背景和挑战

  • KVCache 的作用和技术原理
  • KVCache 的常见优化思路
  • vLLM Prefix Caching 的局限性
  • KVCache 缓存对 PD 分离架构的影响

2. YRCache 多级缓存技术方案

  • YRCache 数据的元数据管理方案
  • YRCache 缓存数据的管理策略
  • YRCache 多级缓存和调度器的协同优化
  • YRCache 多级缓存对 PD 分离架构的优化

3. 针对推理业务的加速效果实践

  • RAG 知识库场景的实践效果
  • 代码生成场景的实践效果
  • 多轮对话场景的实践效果

4. 总结和展望

  • KVCache 多级缓存带来的收益
  • KVCache 多级缓存的未来演进路线

演讲亮点

  • 深度解析 KVCache 技术原理
  • 深度解析 KVCache Offloading 主流方案
  • 焱融 YRCache 方案的技术架构与整体解决方案
  • 详实分享多个实际业务场景的加速效果

听众收益

  • 了解 KVCache 的技术原理与应用价值
  • 掌握 vLLM 生态主流的 KVCache Offloading 方案以及架构差异与优劣势
  • 了解 KVCache 的适用场景以及不同场景中的最佳实践参考,助力技术选型与系统优化

交通指南

上海浦东滨江喜来登酒店

SHERATON SHANGHAI PUDONG RIVERSIDE
地址:上海浦东大道2288号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手