毕业于浙江大学计算机专业硕士,拥有超过 15 年分布式存储、大规模云存储架构及数据基础设施建设经验。曾就职于华为、联想、美团、金山云等企业,长期负责大规模存储系统的架构设计、技术研发与工程落地,参与构建并支撑千节点级公有云存储集群。现任焱融科技首席架构师,负责全栈 AI 存储产品的架构设计与技术演进。长期专注于 AI 数据基础设施与分布式存储技术,围绕大模型训练、推理及智能应用等场景,重点探索高吞吐、低延迟、弹性扩展的存储架构,为 AI 工作负载提供高效的数据基础支撑。
毕业于浙江大学计算机专业硕士,拥有超过 15 年分布式存储、大规模云存储架构及数据基础设施建设经验。曾就职于华为、联想、美团、金山云等企业,长期负责大规模存储系统的架构设计、技术研发与工程落地,参与构建并支撑千节点级公有云存储集群。现任焱融科技首席架构师,负责全栈 AI 存储产品的架构设计与技术演进。长期专注于 AI 数据基础设施与分布式存储技术,围绕大模型训练、推理及智能应用等场景,重点探索高吞吐、低延迟、弹性扩展的存储架构,为 AI 工作负载提供高效的数据基础支撑。
RAG 场景下,主流引擎的 KV Cache 复用建立在严格前缀匹配之上,而检索结果会随查询动态重排——同样的文档块换个顺序就不再是同一个前缀。结果是块级内容冗余很高,缓存命中率却接近于零。
出路是跨块复用:允许块级 KV 直接拼接,不再考虑顺序。代价是块间 cross-attention 全部缺失,精度显著下降。已有方案用部分重计算来补救,但在 20% 这种实际可接受的重算预算下,精度相对损失普遍达到 30%~50%。我们认为根因是那些全局显著、但与用户问题无关的 token,把有限的重算预算占满了。
ProphetKV 换了一个目标:不去重建全部 cross-attention,只恢复用户问题真正会与之交互的部分。支撑它的是一个此前被忽略的观测——早在 prefill 阶段、decode 尚未开始时,用户问题自身的注意力分布就已经与后续生成 token 的注意力模式高度一致,跨模型跨数据集都很稳健。据此我们推导出以问题注意力为主因子的价值函数,并用两阶段流程在尊重层间依赖的前提下完成选择与重算。20% 重算比下保留全量 prefill 精度的 96%,prefill 耗时相比全量重算下降约 4.6 倍,且完全免训练。
演讲大纲
这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
微信联系我们

