姜慧强,微软亚洲研究院上海实验室的研究型软件开发工程师,毕业于北京大学。他的研究主要集中在高效推理和训练方法上,包括动态稀疏注意力(MInference)、提示压缩(LLMLingua)、KV 缓存压缩、推测性解码、模型压缩、稀疏推理(PIT)、神经架构搜索和高效调优,特别是在大型语言模型上。他在 NeruIPS、ACL、EMNLP、ICCV 等顶会上发表过数十篇论文,并作为审稿人和 AC 服务于社区。
Long-context LLMs Inference的prefilling 阶段由于 Computation bottleneck 造成的长时延 (单卡 A100,1M 8B 约 30 分钟) 给 Long-context LLMs 的应用造成了困难。而 Attention 尤其是Long-context Attention 实际上是非常稀疏且动态的。利用这种动态稀疏性,我们将 Long-context Attention 存在的动态稀疏归纳成三种 Pattern,通过离线搜索出每个 Head 最优的稀疏Pattern,并利用很小的 overhead 在线确定动态稀疏 index,再结合动态稀疏编译器 PIT 和 Triton 进行高效的动态稀疏 GPU 运算,产生实际加速比。我们对市面上主流的 Long-context LLMs , like LLaMA-3-1M, GLM-4-1M, Yi-200K, Phi-3-128K, Qwen2-128K 在RULER,InfiniteBench,Needle Test,LM 等任务中进行了测试,结果显示其具有几乎相同的性能。
本次演讲将主要跟大家分享 LLMs 推理算法侧优化方法,包括量化,剪枝,模型架构优化,FFN 动态稀疏计算等方面的研究和实践。
演讲提纲
1. LLMs 推理算法侧优化方法讨论:如量化,剪枝,模型架构优化,FFN 动态稀疏计算等
2. 长文本 LLMs Inference 遇到的一些挑战
3. 研究思考
4. 解决方案
5. 总结和未来展望
实践痛点
演讲亮点
听众收益



微信咨询

电话咨询
微信联系我们

