Agent as a Service

会议室:待定
出品人:许晓斌

随着模型能力的不断提升,Agent 被越来越广泛地应用,Agent 能够执行越来... 展开 >

专题出品人:许晓斌

阿里巴巴技术总监

许晓斌,阿里巴巴技术风险和效能部技术总监,负责研发和基础设施平台,有多年管理经验。《Maven 实战》作者,关注 AI Coding,分布式架构,技术管理。

专题:Agent as a Service

随着模型能力的不断提升,Agent 被越来越广泛地应用,Agent 能够执行越来越长程的任务,本地的 Agent 逐渐无法满足一些任务形态,包括异步的各类任务,多任务的并行,团队的共享任务等等。 托管形态的 Agent as a Service 逐渐变得重要,本专题讨论这个方向的内容,包括但不限于:

  • 托管 Agent 服务的架构,例如手脑分离,和本地 Agent 的交互
  • 托管 Agent 服务的调度控制、状态/会话管理,底层并发控制,存储管理
  • 安全能力,如密钥管理,沙箱隔离,文件系统隔离

 

by 李俊

蚂蚁集团
Agent 工程师

AI Coding 把个人写码效率抬高后,整条链路仍常卡在联调:环境搭不齐、流量跑不准、问题查不清、环境养不住。根因接近阿姆达尔定律——生码只占链路一部分,环境与验证才是新瓶颈。本演讲基于大型微服务体系线下联调实践,讲述如何把既有 DEV/Stable 地图上翻为 Agent 可使用的 AI 研发环境(ADE):以沙箱提供可日抛执行面,以 Artifact FS 统一上下文与产物,以 Agent 友好终端提供可观测可编排的行动语言。分享从「给人用的 1.0–3.0」到「给 Agent 用」的选型取舍、踩坑与可量化收益,以及人机协同边界如何划。

演讲提纲

  • 背景:Coding 提速后,环境与验证为何成为新瓶颈(案例 + 数据)
  • 问题拆解:搭不齐 / 跑不准 / 查不清 / 养不住,对 Agent 闭环的放大效应
  • 演进回顾:工具→产品→解决方案→可测性专项,为何仍不够
  • 技术方案:ADE 三件套——沙箱、Artifact FS、Agent 友好终端(架构与关键决策)
  • 实践与踩坑:冷启动、输出灌爆 Context、环境漂移、权限与隔离 tradeoff
  • 效果与边界:哪些环节可 Agent 自主,哪些必须人指挥;总结与展望

实践痛点

  • 沙箱日抛 vs 环境保鲜成本
  • 全量终端输出 vs Agent token/延迟
  • 文件系统统一语义 vs 存量 Git/制品异构
  • 给人用的控制台体验 vs Agent 可编程接口——每项都要在稳定性、成本、可观测之间取舍,且 Agent 失败模式比人更「脆」

演讲亮点

  • 把 Infra 主用户从「人」切换为「Agent」,同一张线下地图做 Agent 化,而不是另建一套演示环境
  • 用「沙箱 + Artifact FS + Agent 终端」拼出可写、可记、可观测的闭环,而不是只堆更多 Coding Agent 插件

听众收益

  • 建立「环境与验证驱动」的判断框架
  • 拿到可落地的 ADE 能力拆分与选型 checklist
  • 带走可复用的踩坑清单(冷启动、输出、漂移、隔离)
  • 明确人机边界,避免把 Agent 研发做成不可运营的黑盒

by 方宇晨

上汽集团
云计算中心架构师

Agent 时代,AI 应用正在从“生成内容”快速走向“自主执行”,可运行模型生成代码,操作浏览器,调用 MCP Tool 和内部业务系统。

企业级 Agent Infra 面临的核心矛盾:

  • 运行时隔离要求高。Agent 会运行模型生成的未知代码,需要同时保证文件系统和内核的隔离,传统容器隔离无法单独承担完整安全边界。
  • 网络环境复杂。Agent 既需要访问 Internet、模型 API 还有企业内部系统,需要同时提供独立的 L3/L4 网络隔离。
  • 权限控制严格。一个 Agent 可以调用的 API 权限必须经过严格授权和控制。
  • 凭证风险高。各类凭证一旦直接进入 Agent,理论上就可能被读取甚至泄漏。

实践思路

以 Kubernetes Agent Sandbox 作为可信执行环境,以 OVN-Kubernetes 构建多租户网络边界,以 Istio Sidecar 配合租户级别 Egress Gateway 构建 L7 服务访问平面,以 Keycloak 建立统一的Agent身份体系,并进一步实现 Agent 凭证代理和动态凭证交换。

演讲提纲

1. Agent 时代为什么需要新的企业基础设施

企业 Agent Infra 的核心问题已经不只是“如何运行 Agent”,而是如何建立 Agent 的执行边界、身份边界和网络边界。

企业级 Agent 至少需要四层

  • Compute Isolation:Kubernetes Agent Sandbox
  • L3/L4 Network Isolation:OVN-Kubernetes 多租户网络
  • L7 Service/API Isolation: Istio Service Mesh
  • Identity Isolation: Keycloak

2. Sandboxed Agent:Sandbox 成为 Agent 的可信执行空间

  • Sandbox 作为承载 Agent 的运行时,提供可行的执行空间 gvisor/Kata
  • 支持 Warm Pool, Template,Idle Reclaim, Snapshot 等能力

3. OVN-Kubernetes:构建企业 Agent 的多租户网络

Agent 网络隔离不能只依赖 Kubernetes NetworkPolicy,应当给不同租户建立真正独立的网络域。构建独立的L3/L4网络边界

OVN-Kubernetes支持

  • 每租户独立逻辑网络
  • 独立地址空间
  • 独立路由域
  • 租户间默认隔离
  • NetworkPolicy 和 Service 的能力
  • 租户级 Egress IP
  • vxlan+evpn的多集群互通

4. Istio: 构建 Agent 的 L7 访问控制平面

Agent 不应该直接访问企业 API 和互联网,应尽可能将 Agent 之间的访问和外部访问收敛到可控制、可观测的方式

Envoy Sidecar负责:

  • mTLS
  • 强制路由代理
  • Telemetry

Istio 控制面负责:

  • Agent之间访问的 7 层路径
  • AuthorizationPolicy 的权限
  • Agent 访问外部网络的 Egress 路径

独立的 Egress Gateway 负责:

  • 租户的所有出口流量
  • 租户级出口策略审计

5. Keycloak:统一的 Agent 身份体系

使用 Keycloak 统一管理权限,调用服务需要更换 Token,使用短生命周期 Token 来提高安全性

  • 每个 Agent 有独立的 K8s Service Accoun
  • Keycloak 配置身份,Role,Scope,Audience
  • Agent 通过 Keycloak 换取短时间 JWT token
  • 使用 Istio 的 AuthorizationPolicy 决定访问是 Allow 还是 Deny

6. 目前的需要改进的点

  • 简化 OVN-Kubernetes 的网络构建
  • 管理 Token 的逻辑对 Agent 透明
  • 外部 API Key 从 Agent 中移除,进行统一管理,在 Egress Gateway 出进行替换

实践痛点

  • OVN-Kubernetes 的网络构建流程有待简化
  • Token 的管理逻辑需要对 Agent 透明
  • 需将外部 API Key 从 Agent 中移除,改为统一管理,在 Egress Gateway 处完成替换

演讲亮点

  • 技术架构基于 Kubernetes 和成熟开源技术构建,不存在技术绑定问题
  • 企业级解决方案通过运行时隔离,4 层网络隔离,7 层权限控制和用户管理能力构建完成的解决方案

听众收益

  • 了解 Agent 的 Runtime 隔离方案
  • 了解 Agent 的 4 层网络隔离方案
  • 了解 Agent 的 7 层权限控制和用户管理方案

by 李凯

美团
研发总监

本次演讲将美团企业级 Agent 从“能跑”走向“可托付”的平台化实践。模型负责理解与判断,AgentOS 通过 Runtime、Harness、Skill、MCP、CLI、知识库、沙箱、身份注册、权限治理、可观测与评测,让 Agent 能够安全、稳定、持续地执行任务。进一步通过 Multica 将人、Agent、Runtime 和业务流程组织成可追踪、可介入、可恢复、可验收的任务协作体系,并结合 AI SDLC、业务运营、工单托管、袋鼠管家和数字员工等案例,展示企业级 Agent 的落地方法与规模化路径。

演讲提纲

1. 企业级 Agent 的“手脑分离”架构

  • 模型擅长理解、判断和规划,但结果具有不确定性
  • Agent Loop 通过上下文、工具调用和结果回注持续推进任务
  • Harness 提供知识、工具、状态、沙箱、权限和验证
  • 确定性逻辑交给代码,不确定性判断交给模型

2. Catpaw Studio:企业级 AgentOS

  • 无状态 Agent Loop、分布式 Session、短周期沙箱和云端存储
  • Skill、MCP、CLI、知识库和记忆构成能力底座
  • 注册中心统一管理 Agent 身份、权限和责任边界
  • Trace、评测、告警、成本、版本和回滚构成治理闭环
  • 核心目标:让 Agent 可扩展、可隔离、可观测、可接管

3. 从能力复用到任务协作

  • Skill 沉淀任务方法,MCP、CLI 和 Tool 负责真实执行
  • 广场负责能力发现、复用、版本和安全治理
  • Multica 用 Issue、Task、Runtime 和人工审批组织复杂任务
  • AgentOS 解决“可靠执行”,Multica 解决“协作完成”

4. 应用案例

  • 案例一:AI SDLC
    • 产品、架构、开发、测试 Agent 分工接力
    • 独立环境、代码分支、自动测试和 PR 保障交付安全
    • 人在需求、方案和验收节点进行确认
    • 体现 Harness 与 Multica 如何支撑复杂研发任务
  • 案例二:袋鼠管家
    • 面向大规模商家,采用商户级沙箱、工作空间和权限隔离
    • 评测覆盖用例生产、多轮执行、完整 Trace、断言和综合评分
    • 从线上 Bad Case 定位根因,修改 Skill、Prompt 或工具
    • 通过基线与候选版本对照、回归评测和人工审核控制发布
    • 核心认识:评测不是事后打分,而是 Agent 上线的质量门禁

5. 总结

  • 企业级 Agent 的建设重点,不只是提升模型能力,而是建立一套包含执行、状态、权限、协作和评测的完整工程体系,推动 Agent 从“能够运行”走向“值得托付”

实践痛点

  • 模型结果不确定、长链路状态和上下文难管理、多 Agent 协作与权限隔离复杂,且平台割裂使部署、观测、评测和成本治理难以规模化

前沿亮点

  • 以“手脑分离”为核心,系统呈现 AgentOS、无状态 Loop、短周期沙箱、云端状态、Skill/MCP/CLI 生态与 Multica 任务协作的融合实践

听众收益

  • 听众将获得一套从任务选型、平台架构、能力建设到人机协同和质量闭环的可复用方法,理解如何把 Agent 从 Demo 推向安全、可控、可衡量的生产应用

by 许晓斌

阿里巴巴
技术总监

随着 Agent 在过去两年飞速的发展,越来越多的企业用使用 Agent 上线许多系统和服务;随着用户的增多,或者本身服务就是一个关键的生产系统,Agent 行为的可靠性成为了关键问题。此次演讲重点围绕这个挑战分析阿里巴巴是如何设计我们的 Agent 运行时架构,进而一步步地让 AI 能够逐渐承担越来越多的生产系统的交付和运维工作。

演讲提纲

1. 挑战:当 Agent 遇到生产系统

  • 案例分析,风险被放大
  • 根因分析,基建的安全建设不足

2. 核心设计

  • 身份和资源授权
  • 面向 Agent 的交付流水线
  • Guardrail,面向意图的风险判断
  • 多层隔离
  • dry-run

3. 真实案例

  • Agent 自主完成代码/配置发布
  • Agent 自主完成复杂系统运维

4. 开源关键的 Agent 基础设施

  • OpenSandbox
  • OpenCodeReview
  • OpenAgentAuth

交通指南

上海建工浦江皇冠假日酒店

Shanghai Construction Group Pujiang Crowne Plaza Hotel
地址:上海市闵行区陈行公路 3701 号
  • 微信咨询

  • 电话咨询

    联系电话:18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手