专题演讲嘉宾:杨培军

京东架构师

京东零售 AI 域架构师,xLLM 大模型推理开源项目架构师/核心开发者。硕士毕业于北京邮电大学,曾就职于阿里妈妈负责搜索广告架构和 AI Infra 推理系统研发,现于京东零售智能平台部专注大模型推理及生成式推荐能力建设。

by 杨培军

京东
架构师

生成式推荐实现了推荐系统的范式跃迁,却因需同时适配 TB 级稀疏嵌入与十亿级稠密参数架构、满足电商场景百毫秒级时延的严苛要求,面临着巨大的工程落地挑战。通用 LLM 推理框架与生成式推荐 Workload 特性不匹配,传统 Beam Search 在大波束宽度场景下的访存、拷贝、调度瓶颈,严重制约了其规模化应用。本次分享将结合京东工业级落地实践,详解 xGR 高性能推理系统的核心技术创新、电商场景落地成果,以及生成式推荐推理优化的前沿探索方向。

演讲提纲

  1. 行业背景与技术挑战
    • 生成式推荐实现范式跃迁,验证了 Scaling Law 的效果潜力
    • 推荐系统TB级稀疏嵌入参数与LLM百亿级稠密参数,对推理优化提出更高挑战
    • 搜推广场景百毫秒级时延、高并发的严苛要求,成为生成式推荐规模化落地的核心门槛
  2. 行业方案
    • 通用 LLM 推理框架与生成式推荐 Workload 特性不匹配,无法工业级生产部署
    • 传统Beam Search存在重复访存、Block频繁拷贝、计算效率低等核心瓶颈
  3. 技术方案&创新
    • xAttention 分段 KV Cache 优化、xBeam 高效束搜索、xSchedule 全链路流水线调度
    • 基于分段 mask 的融合 Kernel 设计,实现计算与访存的深度协同优化
  4. 核心成果
    • 核心性能指标突破,性能超业界 SOTA 方案
    • 电商核心场景的规模化应用实践
  5. 未来展望
    • 架构全链路升级:实现多模态、多目标、多场景的融合建模与统一推理,探索端到端生成式推荐架构全场景落地
    • 极致性能攻坚:探索 MTP 并行解码、DSA 稀疏注意力等前沿技术,支撑超大规模模型的低时延、高吞吐推理
    • 软硬深度协同:深化 GPU 与国产异构芯片的联合优化,深度挖掘通信、计算、存储的硬件极限性能

这样的技术在实践过程中有哪些痛点?

  • 系统设计、模型结构与底层硬件优化紧密结合,加上真实业务场景中的打磨与验证,通用性、扩展性需要进一步优化。

演讲亮点

  1. 面向生成式推荐场景的 xGR 全栈推理优化方案,攻克通用 LLM 框架场景适配不足的行业共性难题,相关技术成果投稿系统领域顶级国际会议 OSDI 2026;
  2. 核心性能达到业界 SOTA 水准,相比 TensorRT-LLM 等主流开源框架,端到端推理性能提升 1 倍;
  3. 方案完成电商核心业务场景规模化落地,经受住业务峰值流量考验,实现业务效果与算力成本双重优化。

听众收益

  • 工业级生成式推荐推理的前沿实践与核心挑战,包括在真实业务场景中面临的关键问题,以及如何通过系统化技术方案实现高效落地和业务收益等。

交通指南

北京富力万丽酒店

Renaissance Beijing Capital Hotel
地址:北京市朝阳区东三环中路61号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手