Agent 时代,AI 应用正从“回答问题”走向“动手执行任务”:编写和运行代码、操作浏览器与桌面、读写文件、安装依赖、调用内部系统、参与训练与评测。AI 产品进入深水区后,三大矛盾愈发突出:当 Agent 自主性越过传统应用安全边界,当长生命周期会话遇上资源成本约束,当大规模训练和 Tool Use 需要瞬时拉起可信执行环境,传统容器和普通 Serverless 已难以支撑企业级 Agent 的规模化落地。
然而,企业级 Agent 执行环境在实际生产中仍然面临:
-
隔离难 — Agent 会执行模型生成代码、访问文件系统和内部网络,既要放开执行能力,又要守住租户、身份、网络和内核边界
-
启动慢 — 安全容器、镜像拉取、依赖初始化和持久化挂载叠加后,冷启动耗时直接影响在线 Agent 和训练评测体验
-
状态重 — 办公 Agent、Coding Agent、长任务 Agent 需要保留 workspace、依赖、会话和执行上下文,但资源不能长期空转
-
规模大 — Agentic RL 和批量评测会带来镜像风暴、缓存击穿、多集群调度、配额竞争和环境一致性问题
-
治理散 — Harness + Tool Use 场景下,高危动作何时进沙箱、进沙箱后如何共享状态、如何注入身份和审计链路,都不能靠业务代码临时判断
我们的实践:围绕 Sandboxed Agent、Agentic RL、Agent Harness + Tool Use 三类典型场景,构建蚂蚁 ARCA 执行边界体系。ARCA Sandbox 提供安全隔离、缓存池、持久化存储、内存快照、镜像预热、网络隔离与成本治理;Piston 承担 Agent 托管、生命周期管理、灰度发布和自助入驻;Tool Gateway 与运行时策略负责将高危动作路由到受控沙箱中执行。ARCA 在蚂蚁多个重点 Agent 场景中支撑数万级每日沙箱创建、千万级日请求和万核级资源峰值。本次演讲将结合真实生产踩坑,分享企业 Agent 从 Demo 走向规模化落地时,如何设计可信、可恢复、可调度、可审计、可控成本的执行边界。
演讲提纲
1. 行业趋势与 ARCA 背景
- Agent 从“对话式 AI”走向“执行式 AI”的趋势:代码执行、Tool Use、浏览器操作、桌面操作、文件系统读写成为基础能力
- 企业场景下的核心变化:模型风险开始外溢到执行层、网络层、身份层和状态层
- 蚂蚁 Agent 场景的共同诉求:既要让 Agent 充分“动手”,又要让风险、成本和状态可控
- ARCA 的定位演进:从 Agent Sandbox,走向企业 Agent 执行边界基础设施
2. Sandboxed Agent:沙箱作为 Agent 的“家”
本节 takeaway:长期 Agent 不是“跑一个容器”,而是要把计算状态、文件状态、身份状态、网络边界和资源成本分开治理
- 典型场景:内部员工办公 Agent、Coding Agent、OpenClaw / Claude Code 类长期运行任务
- 核心挑战:长生命周期会话、workspace 持久化、依赖安装、内部网络访问、员工身份边界、内核隔离和资源空转
- Piston 产品设计:Agent 模板、配置制品化、生命周期托管、灰度发布、自助入驻、运维监管
- ARCA 执行底座:安全容器、租户隔离、缓存池热分配、持久化存储、checkpoint/restore、出口网关、办公区与沙箱区网络隔离
- 成本治理实践:CPU 超卖、混部、空闲回收、缓存池容量控制、quota 和计量
3. Agentic RL:沙箱作为大规模环境供应链
本节 takeaway:Agentic RL 的瓶颈不只是算力,而是环境供应链;训练环境必须可版本化、可复现、可调度、可观测
- 典型场景:Agentic RL、Reward Server、批量评测、训练任务中的环境批量拉起
- 核心挑战:瞬时创建大量沙箱、镜像大规模拉取、依赖初始化、环境一致性、多集群调度、缓存击穿和训练任务资源竞争
- 镜像与快照链路:镜像中心、分发加速、镜像懒加载、内存快照、模板预热、缓存池复用
- 调度设计:缓存感知调度、多集群路由、租户配额、批量任务优先级、失败重试和资源水位控制
- 可观测与准入:拆解镜像拉取、调度、挂载、启动、ready latency、缓存命中率和失败原因
4. Agent Harness + Tool Use:沙箱作为高危动作执行器
本节 takeaway:Harness + Tool Use 不是“所有东西都进沙箱”,而是把危险 Action 路由进受控执行边界
- 典型场景:主 Agent / Harness 跑在常规服务或 Serverless 中,但代码执行、文件修改、构建测试、外部输入处理和高危系统操作需要进入沙箱
- 核心挑战:哪些动作必须进沙箱、谁来做策略判断、Harness 和 Tool Use Sandbox 如何共享状态、如何注入短期身份、如何保持端到端审计
- 运行时策略:基于 action taxonomy、risk metadata、policy-before-dispatch 决定 host 执行、dry-run、人工审批、sandbox 执行或 deny
- Tool Gateway 设计:把安全决策收敛到平台层,而不是散落在每个业务 tool 的代码里
- 状态共享机制:共享 workspace、artifact store、trace id、输入输出 bundle、session reuse 和 checkpoint/restore
- 身份与审计:短期 delegated identity、最小权限 token、出口网关、调用链追踪和操作审计
5. 统一架构与落地方法论
- ARCA 系统架构:支持大规模业务落地的架构实践
- 三类场景背后的统一 primitive:内核隔离、缓存池、镜像预热、内存快照、持久化存储、checkpoint/restore、出口网关、多集群调度、quota、审计和可观测
- 三种沙箱角色:Sandboxed Agent 中沙箱是 Agent 的家;Agentic RL 中沙箱是环境供应链;Harness + Tool Use 中沙箱是危险动作执行器
- 从 Demo 到生产的经验总结:先定义执行边界,再优化启动性能;先拆状态,再谈弹性;先平台化策略,再放开 Tool Use
实践痛点
- 长会话保持与资源效率的冲突:办公 Agent 和 Coding Agent 希望像云电脑一样长期保存状态,但平台希望空闲即可释放资源,checkpoint/restore、持久化存储和 session reuse 之间需要持续权衡。
- 强隔离与低延迟的根本冲突:安全容器、网络隔离和持久化挂载会天然增加启动成本,缓存池、内存快照和镜像懒加载只能缓解,不能消除所有场景的冷启动压力。
- 真实企业依赖无法简单 clone:很多 Agent 需要访问代码库、构建系统、内部服务、OSS/NAS、办公网络和权限系统,单纯把 Agent 关进沙箱会牺牲业务价值,必须设计网络、身份和出口治理。
- Agentic RL 的环境供应链复杂度被低估:批量训练的难点不只是 GPU/CPU 算力,还包括镜像分发、缓存命中、快照一致性、环境复现、调度公平性和资源隔离。
- Tool Use 沙箱化的边界难定义:哪些动作高危、哪些可以 host 执行、哪些需要审批,不能完全交给模型判断,也不应由业务 tool 自己拍板,需要平台化策略和统一审计。
- Harness 与 Sandbox 的状态共享困难:主 Agent 在外部服务中运行,高危动作在沙箱中执行,二者之间的 workspace、artifact、trace、身份和长任务状态需要显式协议,否则很容易变成不可观测的黑盒。
演讲亮点
- 用三类真实场景重新定义 Agent Sandbox:区别于只讲容器隔离或冷启动优化,本议题把沙箱放到 Sandboxed Agent、Agentic RL、Harness + Tool Use 三种企业落地模式中,讲清沙箱分别作为“Agent 的家”“环境供应链”“危险动作执行器”时的架构差异。
- 从产品托管到执行底座的完整实践:结合 Piston、ARCA Sandbox、缓存池、持久化存储、网络隔离、内存快照、镜像预热和 Tool Gateway,呈现一个从 Agent 生命周期管理到低层执行环境的端到端工程体系。
- 强调企业 Agent 的执行边界方法论:不是泛泛讨论“要不要 sandbox”,而是给出可复用判断框架:Agent 自主性在哪里、风险动作在哪里、状态在哪里、身份在哪里、成本在哪里。
- 真实规模与踩坑经验:议题基于蚂蚁内部多个重点 Agent 场景的落地经验,覆盖数万级每日沙箱创建、千万级日请求、万核级资源峰值下的性能、稳定性、安全、成本和可观测问题。
听众收益
- 掌握企业级 Agent 执行环境的完整设计框架:了解如何从 Sandboxed Agent、Agentic RL、Harness + Tool Use 三类场景出发,设计不同的隔离、状态、调度和治理方案。
- 获得可复用的 Agent Sandbox 选型方法论:知道什么时候应让 Agent 常驻沙箱,什么时候应把沙箱作为批量环境供应链,什么时候应只让高危 Tool Use 进入沙箱。
- 了解 Agent 从 Demo 到生产的真实工程卡点:包括冷启动、镜像风暴、长会话状态、内部网络访问、身份注入、成本治理、Tool 策略路由和端到端审计。
- 借鉴蚂蚁 ARCA 的规模化实践经验:帮助正在建设 Agent 平台、AI Coding 平台、Agentic RL 训练平台或企业 Tool Use 治理平台的团队,提前识别执行层风险,少走从“能跑”到“能规模化运行”的弯路。