基础设施正经历范式迁移:核心构建单元从服务与流程演进为模型与智能体,设计目标从&... 展开 >



分布式系统资深技术专家,中国基础软件开源领域的长期推动者。从 Application Infra、Data Infra 到 AI Infra 三代基础设施范式跃迁中,他始终扎根于底层技术演化与产业落地的交汇,带领团队推动基础软件从开源生态走向大规模生产实践,相关产品历经双十一及大规模企业级生产验证。近年来聚焦 AI/Agent Infra 体系化建设,提出"五大软件新基建"架构方法论,主张 AI 规模化落地的关键瓶颈不在算力规模,而在算力效率。
基础设施正经历范式迁移:核心构建单元从服务与流程演进为模型与智能体,设计目标从"高效服务请求"转向"高效运行模型及其衍生智能体"。2026 年,AI 从模型时代进入智能体时代——重心从训练侧效率转向推理侧效率,GPU-HBM-存储的软硬协同走向深度 co-design。
当前三大结构性挑战:
本专题围绕 AI Infra 全生命周期展开,从算力调度、数据治理、模型训练、推理加速、软硬协同、部署运维到持续进化七个维度,探讨上述挑战的系统性应对与工程化路径:
听众收益
LLM 强化学习中,Rollout 占耗时的相当一大部分,长尾使最早完成 GPU 约 76% 时间空闲。通过大量数据,我们发现发现相邻 epoch 有大量的token 可匹配、因而结合历史推测解码与长度调度,提出 RhymeRL 系统。系统采用离线后缀树、奖励感知选枝、动态窗口、奇偶步互补及尾部迁移,解决在线索引开销、固定窗口无效验证和异常长样本失衡,并取得相比现有系统2.6x 的性能提升。
演讲提纲:
实践痛点:
前沿亮点:
听众收益:
MaaS 业务中的模型、硬件和请求工况变化较快。传统的部署调优和算子优化依赖人工完成需求分析、性能定位、算子开发、验证及上线,优化周期难以跟上生产负载的变化。
本次分享将介绍一套面向 MaaS 生产场景的自动优化流程:给定卡型、模型和典型工况,探索合适的部署配置;从实际运行 Trace 中识别热门算子,并结合当前工况判断是否采用已有的算子融合模式;对典型工况进行归并、清洗、脱敏和泛化,生成可复现的 Benchmark;再由 Atrex Kernel Agent 通过 Agent Loop 完成性能分析、代码生成、验证和持续优化;最后将优化结果回接推理框架,进行端到端性能回归和灰度验证。分享将重点介绍算子优化,以及各环节之间如何衔接。
演讲提纲
实践痛点
演讲前沿亮点
听众收益
强化学习系统的性能瓶颈不仅来自模型训练,也来自 Rollout 数据传输、经验回放和权重同步。Mooncake 面向 RL 场景提供高性能数据面:通过结构化对象、DataProto/typed-ragged、BufferPool 及 RDMA 优化 Rollout 数据流,并接入 Miles 替代 Ray Object Store,支持同步和 Fully Async 两种执行模式。在权重更新方面,Mooncake 同时支持 NCCL Broadcast、TransferEngine P2P RDMA 和 disk-delta,在 Kimi-K2 场景中 P2P 方案约实现 7 倍加速。此外,它还支持 TP/PP/EP/DP 异构 Reshard、Store 权重快照及 MoE 稀疏 Delta,为大规模 RL 训练提供高吞吐、低延迟、可扩展的数据与权重基础设施。
演讲提纲
实践痛点
前沿亮点
听众收益
随着 Coding Agent、企业智能助手等 Agent 应用进入真实生产环境,如何让 Agent 在持续使用过程中不断提升能力,成为下一阶段的重要挑战。传统 Agent 系统产生的大量交互轨迹、工具调用记录和用户反馈通常仅用于日志分析,难以转化为模型能力提升的数据闭环。
本次分享介绍 AReaL 2.0 如何构建面向 Agent 自演进的在线强化学习基础设施。方案通过 Agent 轨迹协议、数据代理层和演进控制平面,将真实业务交互转化为可训练、可回放、可治理的数据,并通过微服务化 Agent-Compute 架构,实现无需重构原有 Agent 即可接入 Online RL。在 Hermes Agent 和软件工程 Agent 场景中,该方案支持大规模并发环境、异步训练和持续优化,使 Agent 从“一次性执行系统”逐步演进为“持续学习系统”。
演讲提纲:
实践痛点:
演讲前沿亮点:
听众收益:
本次分享将帮助听众理解 Agent 基础设施发展的下一阶段趋势:从传统的模型调用和工作流编排,进一步发展到能够持续学习和自我优化的智能体系统。
技术层面,听众可以了解如何构建 Agent Online RL 闭环,包括轨迹协议设计、生产数据采集、Serving 与 Training 融合、奖励反馈管理以及模型更新流程。
工程实践层面,分享将总结真实部署中的关键经验,包括为什么简单日志无法支撑强化学习、为什么在线更新容易导致系统退化、如何通过数据治理和版本管理保障生产稳定性。
对于正在建设企业级 Agent 平台的团队,本次分享能够提供一种新的系统设计思路:无需推倒已有 Agent 架构,而是通过基础设施升级,将现有 Agent 转变为具备持续优化能力的学习型系统,为未来构建“越使用越强”的 AI 应用提供参考。
RAG 场景下,主流引擎的 KV Cache 复用建立在严格前缀匹配之上,而检索结果会随查询动态重排——同样的文档块换个顺序就不再是同一个前缀。结果是块级内容冗余很高,缓存命中率却接近于零。
出路是跨块复用:允许块级 KV 直接拼接,不再考虑顺序。代价是块间 cross-attention 全部缺失,精度显著下降。已有方案用部分重计算来补救,但在 20% 这种实际可接受的重算预算下,精度相对损失普遍达到 30%~50%。我们认为根因是那些全局显著、但与用户问题无关的 token,把有限的重算预算占满了。
ProphetKV 换了一个目标:不去重建全部 cross-attention,只恢复用户问题真正会与之交互的部分。支撑它的是一个此前被忽略的观测——早在 prefill 阶段、decode 尚未开始时,用户问题自身的注意力分布就已经与后续生成 token 的注意力模式高度一致,跨模型跨数据集都很稳健。据此我们推导出以问题注意力为主因子的价值函数,并用两阶段流程在尊重层间依赖的前提下完成选择与重算。20% 重算比下保留全量 prefill 精度的 96%,prefill 耗时相比全量重算下降约 4.6 倍,且完全免训练。
演讲大纲
这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
AgentENV(AENV)是清华大学计算机系 KVCache.AI 团队与月之暗面联合研发的面向智能体的分布式执行环境,目前已在 GitHub 开源。AI Agent 在强化学习训练、模型评测与在线服务中,需要在真实的软件环境中执行复杂操作(读取代码、安装依赖、与数据库交互等),而现有沙箱平台普遍面临成本高、可扩展性有限的瓶颈。
AENV 提出了一套创新解法:通过按需镜像拉取和分层块存储实现高可扩展性;通过内存复用、页面缓存共享及 Balloon 技术大幅提升单机部署密度;通过暂停快照功能显著提升资源利用率。目前,AENV 已深度服务于 Kimi K3 的强化学习训练,在生产环境中成功支撑了超 150 万镜像与 5000 万个执行环境的并发调用,极大降低了基础设施成本。
演讲提纲
实践痛点:
前沿亮点:
听众收益:
在大模型训练数据规模持续提升、模型迭代效率持续加快的背景下,业界在模型数据处理的 GPU 效能、任务稳定性、数据交付时效等方面面临巨大挑战。蚂蚁通过新一代大模型训练数据处理系统 Altum 的建设,尝试系统化解决这些问题。本次分享将重点介绍在性能、稳定性、效率等方面提升的关键技术策略和背后的思考与取舍,以及业务生产实践案例。
演讲提纲:
实践痛点:
前沿亮点:
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

