AI Native 架构

会议室:待定
出品人:王晨纯

过去,软件工程的应用是无状态、被动响应且高度依赖硬编码决策树的,随着行业共识跨越... 展开 >

专题出品人:王晨纯

字节跳动国际电商商家技术负责人

王晨纯,字节跳动国际电商商家技术负责人,前阿里巴巴高级技术专家,从事电商和云计算领域十余年,带领团队主导过研发 / 运维 / 技术服务 / 中间件 / 架构 / 云原生等多项职能的技术工作,当前负责 AI 在多业务场景落地。

专题:AI Native 架构

过去,软件工程的应用是无状态、被动响应且高度依赖硬编码决策树的,随着行业共识跨越了套壳调用模型的初级阶段,当工程师试图将 AI 从单次问答(Chatbot)推向长周期自治任务(Agentic Long-horizon task)时,传统的系统架构面临着紧迫且剧烈的升级需要。

在这一背景下,代码的职责边界正在被重新定义。业务的控制流正逐步交由具备推理能力的模型动态接管,而底层基础设施的核心任务,则转变为给智能体提供安全执行的物理法则、按需流转的上下文环境以及支持循环的运行基座。

由此,AI Native 的应用架构,正经历一场从以 API 与数据流为中心,向以 Agent、Context 与 Loop 为核心的底层范式转移。工程师的日常正从编写业务的增删改查,进阶为认知流与智能体运行的设计者。

本专题将围绕以下方向展开深度研讨,直击 AI 时代软件系统被重新设计的工程内核:

  1. 核心原语与认知控制流重构(Loop Engineering)
  2. 上下文工程与 AI 原生数据平面
  3. 智能体运行基座(Agent Harness)与外部系统交互
  4. 持久化执行(Long-horizon)与运行时治理

专题受众

  • 资深架构师 / Tech Lead:需要为企业规划下一代 AI 基础设施与认知架构体系的技术决策者

  • 后端 / 基础架构工程师:正应对 AI 带来的长周期状态保持、数据库并发瓶颈、以及系统安全沙盒隔离的 Infra 建设者

  • AI 应用 / Agent 开发者:需要将 Agent 推向高可用、高并发生产环境,解决 Agentic 落地过程中各类技术问题的开发者

by 张国强

字节跳动
资深技术专家

AI 正在改变软件的开发方式与运行形态。自然语言编程降低了应用开发门槛,软件的执行主体也开始从用户驱动的 App,扩展到能够自主规划、调用工具并积累上下文的 Agent。这要求 BaaS 不仅提供数据库、认证和存储,还要支持弹性资源、数据分支、应用部署、模型访问、安全执行、长期记忆与知识检索。

本次分享将介绍字节跳动 Supabase 从 App Backend 向 Agent Backend 演进的技术实践:面向 App,通过 Serverless、Data as Git 和前端自动部署支撑应用快速生成与持续迭代;面向 Agent,通过 AI Gateway、Sandbox、记忆库和知识库构建安全、可治理的运行底座。分享将结合豆包应用生成和 TRAE 编程实践,复盘一体化架构的关键取舍与工程难点,并展望 Agent-Native BaaS 的后续演进方向。

演讲提纲

1. 背景

  • AI 给软件开发方式和运行形态带来的变化
  • BaaS 在 AI Native 架构中的应用

2. 从 App 到 Agent:后端基础设施发生了什么变化

  • AI 应用从用户请求驱动走向模型决策与上下文驱动
  • 传统 BaaS 已经解决什么,生产级 Agent 又增加了哪些问题
  • 字节跳动 Supabase 从 App Backend 向 Agent-Native 能力演进的路径

3. 字节跳动 Agent-Native BaaS 技术方案

  • Serverless: 秒级供给、弹性伸缩与成本治理
  • Data as Git:数据库分支、Schema diff与数据隔离
  • AI Gateway:多模型接入、路由、限流、降级与成本治理
  • 记忆库:记忆写入、压缩、召回、更新与遗忘
  • 知识库:文档处理、向量检索、权限过滤与引用溯源

4. 字节跳动 Supabase 的规模化实践

  • 豆包应用生成实践:让非专业开发者获得完整后端并实现生产级应用
  • Coze 编程实践:使用分支支撑前后端并行试错,实现开发与生产之间的隔离
  • Trae 编程实践:通过skills实现Vibe Coding的一键部署与上线

5. 未来展望

  • 工程实践经验总结
  • Agent-Native BaaS 未来演进方向

实践痛点

  • 规模增长与资源成本之间的矛盾。AI 生成应用数量多、生命周期差异大,流量具有明显不确定性。平台既要支持秒级开通和快速弹性,又要避免大量空闲实例长期占用资源,需要在冷启动、资源池化、隔离强度和成本之间持续权衡
  • 高频试错与数据安全之间的矛盾。Vibe Coding 和 Agent 编程会频繁修改数据库结构、后端逻辑与前端代码。Data as Git 可以支持多分支并行和快速回滚,但数据库分支涉及数据复制、Schema 演进、环境隔离、合并冲突和敏感数据保护,其状态管理与一致性比代码分支更加复杂
  • Agent 自主执行与安全隔离之间的矛盾。Agent 需要在 Sandbox 中运行代码、安装依赖、访问文件和调用外部服务。隔离越强,启动和运行成本通常越高;权限放得越开,数据泄露、恶意代码和越权访问的风险越大,还需要解决状态保持、网络控制、资源配额和操作审计问题
  • 长期记忆与上下文质量之间的矛盾。过期信息、错误结论和低价值内容如果持续进入上下文,会降低 Agent 的判断质量。平台需要处理记忆写入、摘要压缩、召回、更新、遗忘和权限隔离,并区分模型记忆与权威业务事实

演讲亮点

  • Agent Backend 的建设路径,拆解 Serverless、Data as Git、前端部署、AI Gateway、Sandbox、记忆库和知识库所解决的核心问题,以及各项能力之间如何协同
  • 同时覆盖 App 与 Agent 两类后端架构。分享将 App Backend 和 Agent Backend 放在统一框架中分析,既说明两者可以复用的数据库、身份、存储和事件能力,也明确 Agent 在模型治理、安全执行、长期记忆和知识检索方面新增的基础设施需求
  • 结合豆包和 TRAE 的落地案例。通过应用生成和 AI 编程两类场景,展示 App Backend 与 Agent Backend 的不同诉求,复盘实际建设中的技术选择、架构边界和演进过程
  • 给出 Agent-Native BaaS 的后续演进判断。在现有能力基础上,进一步讨论 Agent 身份、长任务状态、多 Agent 协作、全链路审计和成本预算等未来方向,并分析哪些能力适合由 BaaS 统一承载

听众收益

  • 理解 AI 驱动的软件架构演进。 听众将掌握 AI 对软件开发方式和后端架构带来的核心变化,掌握 BaaS 从服务传统 App 到服务 Agent 的演进逻辑
  • 掌握 App Backend 建设方法。面向应用开发与平台建设,听众可以了解 Serverless、Data as Git 和前端自动部署如何支撑 AI 生成应用的快速创建、并行试错与持续交付
  • 掌握 Agent Backend 核心能力。面向 Agent 系统建设,听众可以掌握 AI Gateway、Sandbox、记忆库和知识库的职责边界,以及模型治理、安全执行、上下文管理和 RAG 落地中的主要工程问题
  • 借鉴字节内部规模化实践经验。通过豆包应用生成和 TRAE 编程实践,听众还可以了解 AI 应用从原型走向规模化运行时容易遇到的真实问题,减少重复踩坑,并形成适合自身业务的 Agent-Native 后端演进路径

by 刘中兵

快手
架构治理团队 & AI 架构演进负责人

AI 时代架构如何演进,是快手乃至整个行业正在面对的核心命题。当 AI 应用爆发式增长,当 Agent 各自为政形成新的烟囱孤岛,当 Token 成本失控而 ROI 无从衡量,当 AI 生成的代码缺少规范兜底——传统的"先建设后治理"路径已难以为继,AI 原生架构演进正成为公司级必答题。

然而,AI 架构演进在实际落地过程中仍然面临:

  • 方向不明
    • ​AI 带来的架构问题域尚无行业共识,优先级缺乏依据 共识不足
    • 各条业务诉求各异,基建与业务的分工边界模糊 规范缺失
    • CLI/Skill/Agent 无统一标准,安全鉴权与数据隔离红线未建 落地难
    • 从规划到闭环缺少验证资产,治理依赖人力推动难以规模化
  • 我们的实践
    • ​联合各业务领域架构师,通过"发散研讨→收敛共识→规范制定→能力建设→业务落地"五步闭环,形成快手 AI 原生架构演进的全局规划与打法体系——守住安全底线、打通 Agent 能力、建立 CLI 规范、推动治理 AI 化,最终达成:“让 AI 用得通、稳、省、好、久”。

本次演讲我将结合快手 AI 架构研讨与落地的实战经验,分享我们总体 AI 架构演进打法的落地路径。

演讲提纲

1. 行业趋势与认知:AI 把架构改成什么样子? 业界是怎么做的?

  • 6 代架构演进主线
  • AI 增强 vs AI 原生
  • 行业对 AI 风险认知
  • 行业 AI 架构白皮书参考
  • 网信办安全要求

2. 公司现状与痛点:公司遇到了什么问题? 挑战在哪里?

  • 行业拐点在 26 年
  • 公司 5 万 AI 应用爆发
  • AI 私搭乱建的案例
  • 架构痛点与挑战

3. AI 架构蓝图规划:AI 原生架构应该怎么建?AI 架构与传统架构的共生关系?

  • 快手架构师 8 大视角
  • 架构师在 AI 中的职责
  • AI 原生架构 5 层技术栈
  • 工具 CLI/Skill/MCP/Agent
  • AI 架构八大设计原则
  • AI 时代架构蓝图
  • AI 架构/传统架构关系

4. AI 架构如何演进:看到什么重点问题?用什么方案解决?

  • 架构:定义/分类/协议
  • 服务:全面 CLI 化
  • 工程:规范/评价/框架
  • 安全:Agent 数字身份
  • 成本:TokenROI /归因
  • 稳定:Agent /模型观测
  • 引擎:评测/切换/部署

5. AI 架构如何落地:先做什么后做什么?各方如何共建?

  • 先做什么后做什么?
  • 各方需要做什么?
  • 有哪些基建发布?
  • 业务如何参与?

实践痛点

  • 如何拉通业务真实的痛点,并且区分清楚什么是真痛点、什么是假痛点
  • 技术解决方案属于首次做,部分细节行业也没有更多的研究和参考案例,比如 Agent 如何定义和分类,数字身份如何分类和区分鉴权,要解决 Agent 和模型的什么安全和稳定性问题等

前沿亮点

  • 行业第一家讲 AI 架构演进规划
  • 更多要进行的是公司内的最佳落地实践

听众收益

  • AI 架构规划:AI 架构师、技术管理者
  • AI 落地应用:AI 应用工程师、AI 平台建设者

by 林鑫

蚂蚁集团
高级技术专家

Agent 时代,AI 应用正从“回答问题”走向“动手执行任务”:编写和运行代码、操作浏览器与桌面、读写文件、安装依赖、调用内部系统、参与训练与评测。AI 产品进入深水区后,三大矛盾愈发突出:当 Agent 自主性越过传统应用安全边界,当长生命周期会话遇上资源成本约束,当大规模训练和 Tool Use 需要瞬时拉起可信执行环境,传统容器和普通 Serverless 已难以支撑企业级 Agent 的规模化落地。

然而,企业级 Agent 执行环境在实际生产中仍然面临:

  • 隔离难 — Agent 会执行模型生成代码、访问文件系统和内部网络,既要放开执行能力,又要守住租户、身份、网络和内核边界

  • 启动慢 — 安全容器、镜像拉取、依赖初始化和持久化挂载叠加后,冷启动耗时直接影响在线 Agent 和训练评测体验

  • 状态重 — 办公 Agent、Coding Agent、长任务 Agent 需要保留 workspace、依赖、会话和执行上下文,但资源不能长期空转

  • 规模大 — Agentic RL 和批量评测会带来镜像风暴、缓存击穿、多集群调度、配额竞争和环境一致性问题

  • 治理散 — Harness + Tool Use 场景下,高危动作何时进沙箱、进沙箱后如何共享状态、如何注入身份和审计链路,都不能靠业务代码临时判断

我们的实践:围绕 Sandboxed Agent、Agentic RL、Agent Harness + Tool Use 三类典型场景,构建蚂蚁 ARCA 执行边界体系。ARCA Sandbox 提供安全隔离、缓存池、持久化存储、内存快照、镜像预热、网络隔离与成本治理;Piston 承担 Agent 托管、生命周期管理、灰度发布和自助入驻;Tool Gateway 与运行时策略负责将高危动作路由到受控沙箱中执行。ARCA 在蚂蚁多个重点 Agent 场景中支撑数万级每日沙箱创建、千万级日请求和万核级资源峰值。本次演讲将结合真实生产踩坑,分享企业 Agent 从 Demo 走向规模化落地时,如何设计可信、可恢复、可调度、可审计、可控成本的执行边界。

演讲提纲

1. 行业趋势与 ARCA 背景

  • Agent 从“对话式 AI”走向“执行式 AI”的趋势:代码执行、Tool Use、浏览器操作、桌面操作、文件系统读写成为基础能力
  • 企业场景下的核心变化:模型风险开始外溢到执行层、网络层、身份层和状态层
  • 蚂蚁 Agent 场景的共同诉求:既要让 Agent 充分“动手”,又要让风险、成本和状态可控
  • ARCA 的定位演进:从 Agent Sandbox,走向企业 Agent 执行边界基础设施

2. Sandboxed Agent:沙箱作为 Agent 的“家”

本节 takeaway:长期 Agent 不是“跑一个容器”,而是要把计算状态、文件状态、身份状态、网络边界和资源成本分开治理

  • 典型场景:内部员工办公 Agent、Coding Agent、OpenClaw / Claude Code 类长期运行任务
  • 核心挑战:长生命周期会话、workspace 持久化、依赖安装、内部网络访问、员工身份边界、内核隔离和资源空转
  • Piston 产品设计:Agent 模板、配置制品化、生命周期托管、灰度发布、自助入驻、运维监管
  • ARCA 执行底座:安全容器、租户隔离、缓存池热分配、持久化存储、checkpoint/restore、出口网关、办公区与沙箱区网络隔离
  • 成本治理实践:CPU 超卖、混部、空闲回收、缓存池容量控制、quota 和计量

3. Agentic RL:沙箱作为大规模环境供应链

本节 takeaway:Agentic RL 的瓶颈不只是算力,而是环境供应链;训练环境必须可版本化、可复现、可调度、可观测

  • 典型场景:Agentic RL、Reward Server、批量评测、训练任务中的环境批量拉起
  • 核心挑战:瞬时创建大量沙箱、镜像大规模拉取、依赖初始化、环境一致性、多集群调度、缓存击穿和训练任务资源竞争
  • 镜像与快照链路:镜像中心、分发加速、镜像懒加载、内存快照、模板预热、缓存池复用
  • 调度设计:缓存感知调度、多集群路由、租户配额、批量任务优先级、失败重试和资源水位控制
  • 可观测与准入:拆解镜像拉取、调度、挂载、启动、ready latency、缓存命中率和失败原因

4. Agent Harness + Tool Use:沙箱作为高危动作执行器

本节 takeaway:Harness + Tool Use 不是“所有东西都进沙箱”,而是把危险 Action 路由进受控执行边界

  • 典型场景:主 Agent / Harness 跑在常规服务或 Serverless 中,但代码执行、文件修改、构建测试、外部输入处理和高危系统操作需要进入沙箱
  • 核心挑战:哪些动作必须进沙箱、谁来做策略判断、Harness 和 Tool Use Sandbox 如何共享状态、如何注入短期身份、如何保持端到端审计
  • 运行时策略:基于 action taxonomy、risk metadata、policy-before-dispatch 决定 host 执行、dry-run、人工审批、sandbox 执行或 deny
  • Tool Gateway 设计:把安全决策收敛到平台层,而不是散落在每个业务 tool 的代码里
  • 状态共享机制:共享 workspace、artifact store、trace id、输入输出 bundle、session reuse 和 checkpoint/restore
  • 身份与审计:短期 delegated identity、最小权限 token、出口网关、调用链追踪和操作审计

5. 统一架构与落地方法论

  • ARCA 系统架构:支持大规模业务落地的架构实践
  • 三类场景背后的统一 primitive:内核隔离、缓存池、镜像预热、内存快照、持久化存储、checkpoint/restore、出口网关、多集群调度、quota、审计和可观测
  • 三种沙箱角色:Sandboxed Agent 中沙箱是 Agent 的家;Agentic RL 中沙箱是环境供应链;Harness + Tool Use 中沙箱是危险动作执行器
  • 从 Demo 到生产的经验总结:先定义执行边界,再优化启动性能;先拆状态,再谈弹性;先平台化策略,再放开 Tool Use

实践痛点

  • 长会话保持与资源效率的冲突:办公 Agent 和 Coding Agent 希望像云电脑一样长期保存状态,但平台希望空闲即可释放资源,checkpoint/restore、持久化存储和 session reuse 之间需要持续权衡。
  • 强隔离与低延迟的根本冲突:安全容器、网络隔离和持久化挂载会天然增加启动成本,缓存池、内存快照和镜像懒加载只能缓解,不能消除所有场景的冷启动压力。
  • 真实企业依赖无法简单 clone:很多 Agent 需要访问代码库、构建系统、内部服务、OSS/NAS、办公网络和权限系统,单纯把 Agent 关进沙箱会牺牲业务价值,必须设计网络、身份和出口治理。
  • Agentic RL 的环境供应链复杂度被低估:批量训练的难点不只是 GPU/CPU 算力,还包括镜像分发、缓存命中、快照一致性、环境复现、调度公平性和资源隔离。
  • Tool Use 沙箱化的边界难定义:哪些动作高危、哪些可以 host 执行、哪些需要审批,不能完全交给模型判断,也不应由业务 tool 自己拍板,需要平台化策略和统一审计。
  • Harness 与 Sandbox 的状态共享困难:主 Agent 在外部服务中运行,高危动作在沙箱中执行,二者之间的 workspace、artifact、trace、身份和长任务状态需要显式协议,否则很容易变成不可观测的黑盒。

演讲亮点

  • 用三类真实场景重新定义 Agent Sandbox:区别于只讲容器隔离或冷启动优化,本议题把沙箱放到 Sandboxed Agent、Agentic RL、Harness + Tool Use 三种企业落地模式中,讲清沙箱分别作为“Agent 的家”“环境供应链”“危险动作执行器”时的架构差异。
  • 从产品托管到执行底座的完整实践:结合 Piston、ARCA Sandbox、缓存池、持久化存储、网络隔离、内存快照、镜像预热和 Tool Gateway,呈现一个从 Agent 生命周期管理到低层执行环境的端到端工程体系。
  • 强调企业 Agent 的执行边界方法论:不是泛泛讨论“要不要 sandbox”,而是给出可复用判断框架:Agent 自主性在哪里、风险动作在哪里、状态在哪里、身份在哪里、成本在哪里。
  • 真实规模与踩坑经验:议题基于蚂蚁内部多个重点 Agent 场景的落地经验,覆盖数万级每日沙箱创建、千万级日请求、万核级资源峰值下的性能、稳定性、安全、成本和可观测问题。

听众收益

  • 掌握企业级 Agent 执行环境的完整设计框架:了解如何从 Sandboxed Agent、Agentic RL、Harness + Tool Use 三类场景出发,设计不同的隔离、状态、调度和治理方案。
  • 获得可复用的 Agent Sandbox 选型方法论:知道什么时候应让 Agent 常驻沙箱,什么时候应把沙箱作为批量环境供应链,什么时候应只让高危 Tool Use 进入沙箱。
  • 了解 Agent 从 Demo 到生产的真实工程卡点:包括冷启动、镜像风暴、长会话状态、内部网络访问、身份注入、成本治理、Tool 策略路由和端到端审计。
  • 借鉴蚂蚁 ARCA 的规模化实践经验:帮助正在建设 Agent 平台、AI Coding 平台、Agentic RL 训练平台或企业 Tool Use 治理平台的团队,提前识别执行层风险,少走从“能跑”到“能规模化运行”的弯路。

交通指南

上海建工浦江皇冠假日酒店

Shanghai Construction Group Pujiang Crowne Plaza Hotel
地址:上海市闵行区陈行公路 3701 号
  • 微信咨询

  • 电话咨询

    联系电话:18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手