随着大模型和智能体系统进入规模化应用阶段,算力已从技术资源转变为核心生产成本。无... 展开 >




2019年博士毕业于清华计算机系。主要研究领域为性能分析及性能优化、并行计算、异构计算、集群资源调度等。发表CCF-A类论文十余篇,申请发明专利多项。现担任清程极智科技有限公司CEO。
随着大模型和智能体系统进入规模化应用阶段,算力已从技术资源转变为核心生产成本。无论是自建集群的大型公司,还是依赖云计算的中小团队,如何在保证算法效果的前提下降低算力消耗,正成为 AI 工程成败的关键因素。本专题聚焦模型训练与推理过程中的工程实践与效率问题,包括推理加速、低成本训练、在线/离线协同与资源优化。重点在于持续降低为获得满足业务需求的模型效果所需要消耗的算力成本。
大模型赋能千行百业,其推理系统作为支撑引擎,面临着推理成本高的挑战。本报告将从内存管理、编译优化、模型量化和并行策略四个关键维度,深入剖析大模型推理系统的关键技术。本次分享将探讨高效的内存管理方法、编译优化、模型压缩与量化,以及并行推理策略,为构建高效、低成本的大模型推理系统提供参考。同时,我们针对国产智能算力研制了“赤兔”大模型推理引擎,有效提升国产算力上大模型的推理效率。
这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
Agent 技术的应用落地对 MaaS 提出了更高的要求和挑战,其中最突出的挑战就是上下文长度显著提升,因此如何提升 KV Cache 的承载能力成为高性能 MaaS 系统的重要方向。本次演讲将会介绍无问芯穹提出的无损 KV Cache 压缩技术,我们发现 KV Cache 存储中有显著的冗余存在,可以获得接近 1.5 倍无损压缩。KV Cache 压缩既可以在 Prefill 阶段提升等效 KV Cache 容量,也可以在 Decode 阶段提升系统并发能力,从而显著提升推理效率。
演讲提纲
演讲亮点
听众收益
蓝耘元生代从0开始做 MaaS,从单节点调度,到大规模多集群多数据中心,从硬抗 MaaS API 流量洪峰,到分时调用,智能调度。解决了工作时间流量洪峰,闲时流量断崖下滑导致资源使用率低等一系列问题。实现了单天千亿 tokens 的稳定高效调用实践。
演讲提纲
这样的技术在实践过程中有哪些痛点?
人工智能市场变化太快,一个新的技术热潮迭代只要几个月时间,API 网关的复杂设计虽然解决了调度效率,但是在适应市场变化的过程中也要跟着快速迭代,这很考验蓝耘 MaaS 产研团队的技术迭代速度。
演讲亮点
行业中的 MaaS API 网关调度多是规模小功能简单调度不智能,蓝耘 MaaS API 网关通过技术和业务的特性来智能调度,很好的适应了大规模多集群多机房,非线性流量调度的场景。
听众收益
了解当前 MaaS 市场的调度痛点,增加智能调度的新思路。
生成式推荐实现了推荐系统的范式跃迁,却因需同时适配 TB 级稀疏嵌入与十亿级稠密参数架构、满足电商场景百毫秒级时延的严苛要求,面临着巨大的工程落地挑战。通用 LLM 推理框架与生成式推荐 Workload 特性不匹配,传统 Beam Search 在大波束宽度场景下的访存、拷贝、调度瓶颈,严重制约了其规模化应用。本次分享将结合京东工业级落地实践,详解 xGR 高性能推理系统的核心技术创新、电商场景落地成果,以及生成式推荐推理优化的前沿探索方向。
演讲提纲
这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

