随着千亿参数级的大语言模型(LLM)、多模态模型(如 CLIP、Flamingo... 展开 >





陈泽裕,百度深度学习技术平台部杰出架构师,现负责文心一言的多硬件推理部署和飞桨(PaddlePaddle)开发套件工作,相关成果支撑文心大模型调用的高速增长,并主导研发了多款覆盖语言、视觉和语音等领域的开源开发套件,在 GitHub 开源社区累计获得超 4 万 Star。曾获得两次百度最高奖。
随着千亿参数级的大语言模型(LLM)、多模态模型(如 CLIP、Flamingo)和生成式 AI 的飞速发展,AI 模型正从“实验室”走向“生产环境”。然而,如何高效、稳定并低成本地将这些模型部署到真实业务场景中,是一个极具挑战性的工程问题。
大模型推理不仅需要处理海量数据,还需要在高并发和低延迟的环境下稳定运行。本专题将聚焦于大模型推理的工程实践,探讨如何通过技术创新、架构优化和工程实践,提升大模型推理的效率和可靠性。
专题可能涵盖的内容:
AI 2.0 模型对算力和数据的需求激增,导致硬件系统的能耗开销逐渐“供不应求”,亟需软硬协同为 AI 行业提供高质量的 AI 系统能效( Tokens/J) 。本次演讲我将介绍软硬件协同优化以提升智能系统能效的研究成果,包括模型稀疏量化压缩、高效推理系统设计与大模型加速器设计。并且结合华为昇腾集群的工程实践,探讨下一代 AI 推理系统的演进趋势。
演讲提纲
1. 大模型推理从 Token 到价值
2. 大模型推理的软硬件协同优化层次
3. 多层次优化技术
4. 华为昇腾大模型推理加速实践
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
随着生成式 AI 与大模型在智能客服、内容创作等场景的广泛落地,大模型推理的成本瓶颈日益凸显。用户和企业对高性能、低成本的推理能力需求持续攀升。自 2024 年以来,飞桨在大模型推理方向持续发力,先后完成了基于 Prefix Caching 以及投机解码的集中式部署架构的优化,随后演进到分离式部署架构,实现了 PD 分离下的 MTP 加速和高性能 EP 并行优化;此外,通过 MEPC 无损压缩技术与针对昆仑芯 P800 芯片的深度适配,进一步提升了端到端推理效率。本次分享我将系统阐释上述优化思路与实战成果,为大模型在产业级落地提供参考。
演讲提纲
1. 大模型推理的背景与挑战
2. 集中式部署阶段的优化实践
3. 分离式部署架构的演进与优化
4. 实践挑战与系统思考
5. 总结与展望
演讲亮点
听众收益
2025 年初,DeepSeek 模型效果跻身全球 AI 第一梯队,且以超低推理成本引发行业震动。面对国内大规模部署需求,如何在国产芯片上实现性能与成本的双重突破成为关键。本次演讲我将深度揭秘昆仑芯团队在 DeepSeek 推理优化中的创新实践:通过软硬结合,实现推理性能数倍提升,TCO 相比 GPU 持平甚至更低,为国产 AI 生态落地提供硬核支撑,助力 DeepSeek 在千行百业规模化应用!
演讲提纲
1. DeepSeek 背景介绍
2. GPU 技术方案解析
3. 昆仑芯关键优化点
4. 总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
2025 年年初,DeepSeek 凭借免费开源的超大语言推理模型迅速走红,掀起了全民部署大模型的热潮。随之而来,如何降低大模型使用成本成为业界关注的焦点。其中,最具吸引力的当属 KVCache “以存代算”技术。
当前,KVCache 缓存技术已成为提升大模型推理效率的行业共识。但要真正发挥其价值,关键在于扩展 KVCache 的存储缓存层以增强大模型的记忆能力,同时存储缓存层也必须具备强大的支持能力。焱融科技基于自研高性能分布式文件系统 YRCloudFile 打造了 YRCache 推理加速方案,显著提升了推理效率和模型推理性价比。
在本次演讲中,我将深入介绍焱融 YRCache 推理加速方案的技术架构和核心能力,并分享其在真实业务场景中的加速效果!
演讲提纲
1. KVCache 的技术背景和挑战
2. YRCache 多级缓存技术方案
3. 针对推理业务的加速效果实践
4. 总结和展望
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

