先后任职于亚马逊、阿里巴巴,拥有 15 年以上大型互联网架构设计与研发经验。技术领域覆盖中间件、推荐系统、云原生、分布式任务调度及 AI 基础设施等核心方向。目前担任阿里巴巴 Sandbox 领域负责人,主导 OpenSandbox 开源项目建设,聚焦 AI 场景下的沙箱运行时与基础设施创新,致力于构建安全、高效、可复用的 AI 执行环境。

先后任职于亚马逊、阿里巴巴,拥有 15 年以上大型互联网架构设计与研发经验。技术领域覆盖中间件、推荐系统、云原生、分布式任务调度及 AI 基础设施等核心方向。目前担任阿里巴巴 Sandbox 领域负责人,主导 OpenSandbox 开源项目建设,聚焦 AI 场景下的沙箱运行时与基础设施创新,致力于构建安全、高效、可复用的 AI 执行环境。
AI Agent 与 RL 训练场景对执行环境提出了全新要求:短生命周期、高并发、可控网络与可复用能力并存,而传统容器体系在启动速度、编程一致性与安全隔离上难以兼顾。
OpenSandbox 是一套面向 AI 时代的开放沙箱运行时框架,采用“Protocol-First”设计,将沙箱生命周期与执行能力抽象为统一协议,解耦 SDK 与 Runtime,并通过 K8s 资源池化与批量调度实现秒级、大规模交付(3.5s 交付 1000 个、10s 交付 5000 个沙箱)。
本次演讲我将结合阿里巴巴内部 Coding Agent、Agent 评测体系与 Coding 场景 RL 训练的真实实践,深入解析 OpenSandbox 在高吞吐执行、细粒度网络安全控制与企业级可扩展性上的关键设计与落地经验。
演讲提纲
1. AI Agent 执行环境的新挑战
2. OpenSandbox 的核心设计:Protocol-First
3. 池化调度与极速交付
4. Agent 场景下的安全执行
5. 真实落地案例
6. 未来演进方向
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
传统软件架构有几个默认前提:
行为是确定的
调用链是可控的
上下文是有限的
这些前提,让我们可以设计稳定、可预测的系统。但 Agent 出现之后,这三件事都开始失效:
行为变成概率性的
执行路径不再完全可控
上下文开始跨越请求持续存在
所以今天我们想讨论的不是“怎么做 Agent”,而是:为了让 Agent 能在生产环境运行,我们到底被迫重写了哪些“架构前提”?以及——这些重写背后的代价是什么?



微信咨询

电话咨询
微信联系我们

