蒋佳军,飞桨大模型部署技术负责人,负责文心大模型在线推理服务,同时负责飞桨大模型高效推理部署套件 FastDeploy 开源工作,在自然语言处理、计算机视觉和推理部署等领域拥有国内外 20 余件发明专利。
随着生成式 AI 与大模型在智能客服、内容创作等场景的广泛落地,大模型推理的成本瓶颈日益凸显。用户和企业对高性能、低成本的推理能力需求持续攀升。自 2024 年以来,飞桨在大模型推理方向持续发力,先后完成了基于 Prefix Caching 以及投机解码的集中式部署架构的优化,随后演进到分离式部署架构,实现了 PD 分离下的 MTP 加速和高性能 EP 并行优化;此外,通过 MEPC 无损压缩技术与针对昆仑芯 P800 芯片的深度适配,进一步提升了端到端推理效率。本次分享我将系统阐释上述优化思路与实战成果,为大模型在产业级落地提供参考。
演讲提纲
1. 大模型推理的背景与挑战
2. 集中式部署阶段的优化实践
3. 分离式部署架构的演进与优化
4. 实践挑战与系统思考
5. 总结与展望
演讲亮点
听众收益



微信咨询

电话咨询
微信联系我们

