生成式 AI 能为各个业务场景带来交互、生成、理解等各方面能力的提升,为大家带来体验上的变革。但大模型的部署会带来算力需求的急剧膨胀,成本问题会非常严重。此外大模型的巨大计算量也会给业务请求带来延迟上的增加,影响 AI 产品的业务体验。本主题主要介绍基于华为昇腾软硬件平台构建大模型推理场景下低成本、低延迟的解决方案,期望软硬结合的解决大模型部署过程的效率和时延问题。
演讲提纲:
1. 昇腾全场景 AI 平台介绍
2. 典型大模型场景部署方案和整体架构
3. 基于 PyTorch 的在线推理模式
4. 基于 IR 的离线部署模式
你将获得:
- 了解大模型推理部署下的关键问题
- 了解华为昇腾在大模型推理场景下的技术能力





