Agent Infra 架构设计

会议室:首府1
出品人:郑然

当今 Agent 作为 AI 原生应用的具体技术形态已经成为行业共识,自 202... 展开 >

专题出品人:郑然

百度杰出架构师,百度智能云基础公有云技术负责人

郑然,百度杰出架构师,百度智能云基础公有云技术负责人。自加入百度以来,一直从事分布式系统和工程架构的研发工作,先后负责大规模分布式索引系统、云原生平台、分布式存储技术、虚拟化和弹性计算技术等大型分布式系统的设计和研发工作。积极参与技术社区活动,多次担任 QCon /TOP 100 等技术大会的联席主席,讲师,出品人等。

地点:首府1

专题:Agent Infra 架构设计

当今 Agent 作为 AI 原生应用的具体技术形态已经成为行业共识,自 2025 年以来 Agent 应用成爆发趋势,越来越多的 Agent 涌现出来。当 Agent 从 Demo 进入真实业务,执行链路长、上下文膨胀、成本失控等问题会迅速暴露。Agent 在工程实现层面如何跑得更快、更稳、更便宜?

本专题将深入 Agent Infra 的设计架构,探讨以下几方面问题:

  • Agent 架构范式: Agent 开发框架, 主要设计模式,推理路径裁剪,并行与缓存策略,失败重试机制等

  • Agent 上下文工程:上下文设计,沙箱运行环境,数据记忆服务,工具服务调用,长上下文推理优化等

  • Agentic-RL 技术: 面向 Agent 的强化学习技术,数据合成,模型训练,环境仿真等

  • Agent 可观测技术:上下文采集,效果评估,数据飞轮等

通过本专题探讨, 希望给观众带来以下核心价值:

  • 应用实践:Agent 应用的架构设计和最佳实践

  • 架构设计:Agent Infra 技术架构的工程优化

  • 效果优化:面向 Agent 应用场景的数据反馈和模型优化

by 陶宇田

阿里巴巴
高级技术专家、研发 TL

AI Agent 与 RL 训练场景对执行环境提出了全新要求:短生命周期、高并发、可控网络与可复用能力并存,而传统容器体系在启动速度、编程一致性与安全隔离上难以兼顾。

OpenSandbox 是一套面向 AI 时代的开放沙箱运行时框架,采用“Protocol-First”设计,将沙箱生命周期与执行能力抽象为统一协议,解耦 SDK 与 Runtime,并通过 K8s 资源池化与批量调度实现秒级、大规模交付(3.5s 交付 1000 个、10s 交付 5000 个沙箱)。

本次演讲我将结合阿里巴巴内部 Coding Agent、Agent 评测体系与 Coding 场景 RL 训练的真实实践,深入解析 OpenSandbox 在高吞吐执行、细粒度网络安全控制与企业级可扩展性上的关键设计与落地经验。

演讲提纲

1. AI Agent 执行环境的新挑战

  • Agent / RL 场景的共性诉求:高并发、短生命周期、可控网络
  • 传统 Docker / K8s 方案的瓶颈与不足

2. OpenSandbox 的核心设计:Protocol-First

  • 两层 OpenAPI:沙箱生命周期与执行能力抽象
  • 多语言 SDK 一致性(Python / Java / JavaScript)
  • Runtime 解耦与可插拔(Docker / K8s)

3. 池化调度与极速交付

  • Pool + BatchSandbox 架构设计
  • 秒级大规模交付:3.5s / 1000,10s / 5000
  • 成本可控的复用与快速回收机制

4. Agent 场景下的安全执行

  • Coding Agent 面临的真实安全网络风险
  • 对比现有方案的不足
  • OpenSandbox 的双层网络防护设计:
  • DNS 层 FQDN 级控制
  • L4 网络过滤

5. 真实落地案例

  • 阿里巴巴内部 Coding Agent
  • 主流 Coding 产品评测架构
  • Coding 场景 RL 训练系统

6. 未来演进方向

  • 安全容器与企业级能力增强
  • 可观测与审计
  • Agent 执行环境的 Serving 化探索

您认为,这样的技术在实践过程中有哪些痛点?

  • 开放性 vs 功能复杂度:避免引入新概念、复用社区成熟概念(以 image 描述环境)
  • 高吞吐 vs 资源成本:池化带来的成本与回收机制权衡
  • 易用性 vs 极致调度效率:基于 K8s 生态与 nomad 的思考

演讲亮点

  • 协议优先:先定义语义,再允许多种运行时实现,确保 SDK 与执行面一致,以及面向未来场景和实现的强大扩展能力
  • 池化调度:面向企业级的大规模短时任务,提供秒级/千级交付能力
  • 网络管控策略:面向 AI 任务的细粒度访问控制,可复用在不同运行时

听众收益

  • 获得一套面向 AI Agent/RL 的“沙箱执行面”抽象方法与协议化设计思路
  • 学到可复用的池化调度设计与性能优化路径
  • 理解高吞吐执行场景下网络访问控制的关键策略与坑点

by 晁岳攀 (鸟窝)

百度
资深工程师

随着智能体在舆情分析、深度研究、知识生产等场景中的广泛应用,越来越多团队发现:“架构图看起来很美,但一上线就开始幻觉、偏题、失控。”

本次分享我将从工程实践视角出发,系统梳理 18 种常见智能体架构模式,并重点讨论这些模式在真实业务场景中的失效方式与边界条件。最后,将结合微舆与 DeepResearch(DeerFlow/Insight 类似项目)的实践经验,深入分享:

1. 为什么某些看似合理的智能体架构,在信息不完整、目标不清晰的场景下会系统性失败;
2. 团队在实践中如何通过模式应用、信息补全、护栏机制,一步步修补这些设计缺陷;
3. 以及这些工程取舍,对未来智能体系统设计带来的关键启示。

这不是一场“架构大全”的介绍,而是一份智能体工程落地的踩坑与反思记录。

演讲提纲

1. 背景:从“降龙十八掌”说起:为什么有那么多智能体架构?

  • 智能体常见架构模式速览:5种常见架构不就好了?
  • 从工程视角拆解 3 类高频模式:
    • 信息不全导致的推理漂移
    • LLM不可避免的幻觉
    • 永动机:跳不出去的怪圈

2. 案例一:微舆智能体——热点跟踪中的"以偏概全"是怎么产生的?

  • AI 驱动的全域监控:MindSpider 爬虫集群 7x24 小时不间断作业,覆盖微博、小红书、抖音、快手、B 站、知乎、贴吧等 7 大关键社媒,下钻至海量用户评论,获取最新最全数据
  • 强大的多模态能力:MediaEngine 深度解析抖音、快手等短视频内容,精准提取天气、日历、股票等结构化多模态信息卡片,确保信息的全面性
  • Agent"论坛"协作机制:ForumEngine 实时监控其他 Agent 日志,利用主持人引导,通过"论坛"机制进行链式思维碰撞与辩论,避免单一模型思维局限
  • 聚类采样防偏斜:InsightEngine 使用 KMeans(SentenceTransformer模型)对搜索结果聚类后采样代表性结果,避免高热度内容主导导致的观点偏斜
  • 超越 LLM 的复合分析引擎:5 类专业 Agent(QueryEngine广度搜索 + MediaEngine多模态 + InsightEngine数据挖掘 + ForumEngine论坛协作 + ReportEngine报告生成),融合关键词优化中间件、情感分析模型、KMeans 聚类采样等统计模型

3. 案例二:DeepResearch(Insight)——深度研究型智能体如何对抗"信息不全 + 幻觉"

  • 多 Agent 协作与有向图编排:9个智能体基于 langgraphgo 协同工作(query_agent→structure_planner→planner→researcher→content_writer→reflector→reviser→reporter→podcast),通过有向图状态传递确保流程可追踪、可恢复
  • 意图澄清机制对抗模糊请求:QueryAgentNode 分析用户意图,提取实体信息(领域、时间范围、目标),将模糊的自然语言转换为结构化的研究请求,避免后续推理偏差
  • 分类制定不同的报表内容通:分别为金融投资、技术开发、商业分析、政策解读、通用行业制定不同的报表内容,确保每篇报告精准且全面
  • Human-in-the-loop 人机协同机制:当用户请求模糊或意图不明确时,系统暂停执行并请求用户澄清;结合用户反馈重构查询,人工干预确保研究方向的准确性,避免"无头苍蝇"式的错误推理
  • 多源搜索对抗信息不全:集成微信、知乎、GitHub、Google Scholar、Tavily 等5种搜索源,针对不同领域使用最合适的搜索工具,避免单一信息源导致的盲区
  • 反思-修订闭环机制对抗幻觉:每个章节完成内容撰写后,ReflectorNode 自动评估完整性,识别缺失信息;ReviserNode 最多执行5次补充搜索,修订直到"内容合格"或达到次数上限
  • 报表内容增加索引资料链接:关键性的报表内容后面增加相关搜索链接,方便用户获取原始资料进行深度研究,避免『幻听』

演讲亮点

  • 不止讲“有哪些架构”,而是讲哪些架构会在哪些真实场景下更适用
  • 通过两个真实产品,系统拆解智能体落地中的工程设计
  • 从幻觉与信息不全问题出发,总结可复用的架构设计原则

听众收益

  • 理解主流智能体架构在真实业务中的适用边界
  • 学会从工程视角,设计更可控、可演进的智能体系统

by 季旭 博士

字节跳动
高级技术专家

火山托管 Mem0 (Managed Mem0) 是一个为 AI Agent 和智能应用设计的专用记忆中间件。它以开源 mem0 为基础,通过全托管、多租户、高可用的 PaaS 服务,解决了在生产环境中构建和维护 AI 长期记忆的复杂性。其核心价值在于提供了一个强化 GraphRAG 能力的统一记忆层,使 AI Agent 能够超越短期上下文窗口的限制,形成对用户、实体及其关系的深刻、持久的理解,从而交付更加个性化、智能和连贯的交互体验。

本次演讲我将重点介绍在字节跳动内我们使用 mem0 来支持 AI Agent 的产品的一些经验和实际落地的案例,包括字节跳动 AI Agent 的痛点与需求,针对这些痛点和需求,火山记忆库 mem0 所做出来的针对性技术方案以及成功的落地案例,最后是我们对未来 AI Agent 的技术判断,希望能给听众带来一些帮助和思考。

演讲提纲

1.  AI Agent 的痛点与需求

  • 记忆的实现与维护复杂:从底层的向量数据库、图数据库选型,到上层的实体关系抽取、多模态内容理解,再到服务自身的弹性伸缩与可观测性,自建一套生产级记忆系统的技术栈复杂、成本高昂
  • 上下文窗口的局限:大语言模型(LLM)的上下文窗口虽然不断扩大,但依然有限且成本高昂。对于需要长期跟踪用户偏好、历史互动和领域知识的场景,简单的上下文填充方案难以为继
  • 浅层语义检索的瓶颈:传统的向量检索(Vector Search)虽然能找到语义相似的文本片段,但难以捕捉和利用实体之间复杂的、隐含的关系,导致 AI 的“思考”缺乏深度和逻辑关联

2. 火山记忆库 mem0 技术方案

  • graphmemory
  • Short-term memory
  • Context graph

3. 火山 mem0 的落地案例

  • 智能客服
  • AI 导购
  • 研发提效
  • 运维数字机器人

4. 未来展望

  • 工程实践经验总结
  • memory 面向 Agent 时代的演进方向

您认为,这样的技术在实践过程中有哪些痛点?

  • 成本与延迟权衡:抽取、向量化、图写入和检索叠加开销,需要通过异步化、限流和策略分层平衡体验与成本
  • 多租户隔离:跨会话、跨租户的租户隔离
  • 双通道可观测性:向量检索和图检索并存时,故障定位和容量规划更复杂,需要统一指标和链路追踪
  • 记忆效果的提升和评测:缺少领域内特定的 Benchmark,Locomo 评估的体系过于静态

演讲亮点

  • 托管化记忆层:提供开箱即用的 API Key 鉴权、限流、异步任务和指标,几行代码即可接入,降低自建成本
  • GraphRAG 工程落地:给出实体和关系抽取、相似度合并、图与向量融合检索和 BM25 重排的可复制方案
  • 典型场景:覆盖客服、导购、研发和运维场景,总结闭环效果和关键踩坑

听众收益

  • 即插即用的接入路径:通过托管 Mem0 的接口快速接入,减少对现有系统的改造。
  • 火山 AI 生态的落地经验:真实的工程实践经验,避免走工程上的弯路
  • 图谱构建与最佳实践:掌握抽取、合并、删除和检索融合的关键参数与实操技巧,构建最佳的记忆效果实践
  • Agent 领域的演进思考:面向 OpenClaw 等最新 Agent 范式 memory 的演进规划和思考- 托管化记忆层:提供开箱即用的 API Key 鉴权、限流、异步任务和指标,几行代码即可接入,降低自建成本
  • GraphRAG 工程落地:给出实体和关系抽取、相似度合并、图与向量融合检索和 BM25 重排的可复制方案。
  • 典型场景:覆盖客服、导购、研发和运维场景,总结闭环效果和关键踩坑

by 郑然

百度
杰出架构师,百度智能云基础公有云技术负责人

by 陶宇田

阿里巴巴
高级技术专家、研发 TL

by 晁岳攀 (鸟窝)

百度
资深工程师

by 季旭 博士

字节跳动
高级技术专家

传统软件架构有几个默认前提:

  • 行为是确定的

  • 调用链是可控的

  • 上下文是有限的

这些前提,让我们可以设计稳定、可预测的系统。但 Agent 出现之后,这三件事都开始失效:

  • 行为变成概率性的

  • 执行路径不再完全可控

  • 上下文开始跨越请求持续存在

所以今天我们想讨论的不是“怎么做 Agent”,而是:为了让 Agent 能在生产环境运行,我们到底被迫重写了哪些“架构前提”?以及——这些重写背后的代价是什么?

交通指南

北京富力万丽酒店

Renaissance Beijing Capital Hotel
地址:北京市朝阳区东三环中路61号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手