无问芯穹技术副总裁,在无问芯穹负责大模型推理和MaaS相关技术研发,支撑日均千亿到万亿级别的MaaS业务。本科与博士毕业于北京大学,香港中文大学博士后,研究方向为深度学习系统,曾任职于北京大学、商汤科技,相关研发成果以第一作者或通信作者获得CCF A类会议ASPLOS 2024最佳论文,CCF A类会议PPoPP 2019最佳论文提名。

无问芯穹技术副总裁,在无问芯穹负责大模型推理和MaaS相关技术研发,支撑日均千亿到万亿级别的MaaS业务。本科与博士毕业于北京大学,香港中文大学博士后,研究方向为深度学习系统,曾任职于北京大学、商汤科技,相关研发成果以第一作者或通信作者获得CCF A类会议ASPLOS 2024最佳论文,CCF A类会议PPoPP 2019最佳论文提名。
Agent 技术的应用落地对 MaaS 提出了更高的要求和挑战,其中最突出的挑战就是上下文长度显著提升,因此如何提升 KV Cache 的承载能力成为高性能 MaaS 系统的重要方向。本次演讲将会介绍无问芯穹提出的无损 KV Cache 压缩技术,我们发现 KV Cache 存储中有显著的冗余存在,可以获得接近 1.5 倍无损压缩。KV Cache 压缩既可以在 Prefill 阶段提升等效 KV Cache 容量,也可以在 Decode 阶段提升系统并发能力,从而显著提升推理效率。
演讲提纲
演讲亮点
听众收益



微信咨询

电话咨询
微信联系我们

