AgentENV(AENV)是清华大学计算机系 KVCache.AI 团队与月之暗面联合研发的面向智能体的分布式执行环境,目前已在 GitHub 开源。AI Agent 在强化学习训练、模型评测与在线服务中,需要在真实的软件环境中执行复杂操作(读取代码、安装依赖、与数据库交互等),而现有沙箱平台普遍面临成本高、可扩展性有限的瓶颈。
AENV 提出了一套创新解法:通过按需镜像拉取和分层块存储实现高可扩展性;通过内存复用、页面缓存共享及 Balloon 技术大幅提升单机部署密度;通过暂停快照功能显著提升资源利用率。目前,AENV 已深度服务于 Kimi K3 的强化学习训练,在生产环境中成功支撑了超 150 万镜像与 5000 万个执行环境的并发调用,极大降低了基础设施成本。
演讲提纲
- 为什么 AI Agent 需要专属执行环境
- 从训练 Rollout、模型评测到在线服务,梳理 Agent 沙箱的核心应用场景
- 拆解代码执行、测试运行、工具调用、文件读写和依赖安装等环境能力
- 分析传统沙箱在成本、环境灵活性和镜像分发效率上的主要局限
- 引出面向大规模 Agent 工作负载的分布式执行环境需求
- 成本压力与环境组合挑战
- 结合训练资源数据,量化执行环境在强化学习流程中的成本占比
- 对比模型调用与沙箱运行开销,分析推理阶段的成本结构
- 拆解传统沙箱平台在环境组合及模板膨胀问题
- 分析传统 OCI 镜像全量下载、解包和高并发分发的性能瓶颈
- AENV 的产品定位与总体架构
- 介绍 AENV 的设计目标、生产规模及其在 Kimi K3 训练中的应用
- 拆解 Gateway、Scheduler、Node 与 Sandbox 的核心职责
- 通过 Firecracker、ublk 和共享存储构建计算、隔离与状态管理体系
- 兼容 E2B、多容器环境和嵌套 Docker,降低现有 Agent 应用的迁移成本
- 高密度部署与弹性调度技术
- 基于 ublk + overlaybd 构建支持远程挂载和按需读取的分层块存储
- 通过“共享只读基底 + 私有写入增量”提升镜像与磁盘复用率
- 将 Page Cache 下沉至宿主机,并结合内存回收机制减少重复占用
- 将低活跃 Sandbox 自动暂停并持久化,释放 CPU 和内存资源
- 结合增量快照与懒加载,实现快速恢复和跨节点调度
- AENV 的落地效果
- 对比按需加载、缓存拉取与冷镜像拉取,验证启动和分发性能
- 结合生产集群数据,评估 CPU、内存复用带来的部署密度提升
- 对比不同沙箱平台的月度成本,分析 AENV 的规模化降本效果
实践痛点:
- 高密度与性能确定性的冲突:CPU 和内存超售能够显著降低成本,但当大量沙箱同时转为活跃状态时,容易出现资源争抢、尾延迟升高和任务超时,需要对沙箱进行精细的控制;
- 按需读取与运行时抖动的冲突:远程镜像无需完整下载即可启动,但首次访问缺失块仍依赖网络和后端存储;网络波动可能从启动等待转化为任务执行过程中的随机停顿。
前沿亮点:
- 生产规模验证:AENV 已服务于 Kimi K3 训练,并支撑约 150 万个镜像和 5000 万个执行环境。
- 将“高密度部署”和“弹性生命周期”统一起来:通过共享基底、私有增量、Page Cache 复用、冷页回收、增量快照和懒加载,既减少单个沙箱的资源占用,也能回收低活跃沙箱占用的集群资源。
- 把远程状态变成本地可用设备:基于 ublk + overlaybd 对远程镜像、磁盘和快照进行块级按需挂载,显著降级镜像分发的性能开销。
- 兼顾性能、成本与生态迁移:AENV 不仅追求启动速度,还提供 E2B 兼容、多容器组合、和多存储后端支持,降低现有 Agent 系统接入新基础设施的改造成本。
听众收益:
- 理解 Agent 执行环境为何会成为模型之外的重要成本中心,掌握训练 Rollout、模型评测和在线服务对沙箱基础设施的不同要求。
- 掌握一套可复用的分布式 Agent Sandbox 架构,包括网关、调度器、执行节点、虚拟机隔离、分层块存储、对象存储和 P2P 分发的职责划分。
- 掌握“共享基底 + 私有增量”,“增量快照 + 懒加载”,“暂停恢复 + 资源调度”等关键设计方法及其适用场景。