生成式推荐实现了推荐系统的范式跃迁,却因需同时适配 TB 级稀疏嵌入与十亿级稠密参数架构、满足电商场景百毫秒级时延的严苛要求,面临着巨大的工程落地挑战。通用 LLM 推理框架与生成式推荐 Workload 特性不匹配,传统 Beam Search 在大波束宽度场景下的访存、拷贝、调度瓶颈,严重制约了其规模化应用。本次分享将结合京东工业级落地实践,详解 xGR 高性能推理系统的核心技术创新、电商场景落地成果,以及生成式推荐推理优化的前沿探索方向。
演讲提纲
- 行业背景与技术挑战
- 生成式推荐实现范式跃迁,验证了 Scaling Law 的效果潜力
- 推荐系统TB级稀疏嵌入参数与LLM百亿级稠密参数,对推理优化提出更高挑战
- 搜推广场景百毫秒级时延、高并发的严苛要求,成为生成式推荐规模化落地的核心门槛
- 行业方案
- 通用 LLM 推理框架与生成式推荐 Workload 特性不匹配,无法工业级生产部署
- 传统Beam Search存在重复访存、Block频繁拷贝、计算效率低等核心瓶颈
- 技术方案&创新
- xAttention 分段 KV Cache 优化、xBeam 高效束搜索、xSchedule 全链路流水线调度
- 基于分段 mask 的融合 Kernel 设计,实现计算与访存的深度协同优化
- 核心成果
- 核心性能指标突破,性能超业界 SOTA 方案
- 电商核心场景的规模化应用实践
- 未来展望
- 架构全链路升级:实现多模态、多目标、多场景的融合建模与统一推理,探索端到端生成式推荐架构全场景落地
- 极致性能攻坚:探索 MTP 并行解码、DSA 稀疏注意力等前沿技术,支撑超大规模模型的低时延、高吞吐推理
- 软硬深度协同:深化 GPU 与国产异构芯片的联合优化,深度挖掘通信、计算、存储的硬件极限性能
这样的技术在实践过程中有哪些痛点?
- 系统设计、模型结构与底层硬件优化紧密结合,加上真实业务场景中的打磨与验证,通用性、扩展性需要进一步优化。
演讲亮点
- 面向生成式推荐场景的 xGR 全栈推理优化方案,攻克通用 LLM 框架场景适配不足的行业共性难题,相关技术成果投稿系统领域顶级国际会议 OSDI 2026;
- 核心性能达到业界 SOTA 水准,相比 TensorRT-LLM 等主流开源框架,端到端推理性能提升 1 倍;
- 方案完成电商核心业务场景规模化落地,经受住业务峰值流量考验,实现业务效果与算力成本双重优化。
听众收益
- 工业级生成式推荐推理的前沿实践与核心挑战,包括在真实业务场景中面临的关键问题,以及如何通过系统化技术方案实现高效落地和业务收益等。