随着大模型智能体(Agent)从实验原型迈向核心业务生产,工程化的重心正经历从&... 展开 >








孙佳林,毕业于华中科技大学软件工程系,现任小红书技术风险负责人,负责公司全局稳定性建设,推动体系化、自动化与可运营的技术风险防控体系从 0 到 1 的建设落地。长期深耕可观测技术、平台工程、高可用架构、AIOps 等领域,近期专注于AI可靠性、AI可观测、LLMOps 与 Agent 工程基建。早期在美团负责全栈可观测产品 Raptor 的从 0 到 1 的建设落地,并负责开源分布式实时监控系统 CAT 的研发与维护。
随着大模型智能体(Agent)从实验原型迈向核心业务生产,工程化的重心正经历从“验证可行性”向“追求确定性”的本质跃迁。不同于传统软件,Agent 深度依赖非确定性推理与动态工具交互,其行为呈现出较强的状态性与路径依赖,形成了难以透视的“语义黑盒”。这种观测缺失与度量困境,已成为制约企业级 Agent 规模化落地的核心瓶颈。
本专题立足架构与工程实战,系统探讨如何构建面向 Agent 的全链路语义观测体系,实现对意图决策、中间状态与工具调用的可追踪、可回放、可诊断;同时通过覆盖离线评测与在线实时度量的评估体系,对任务成功率、路径质量、输出稳定性与效果进行持续量化,驱动 Agent 从“基于经验的盲目调优”转向“基于数据驱动的持续演进”。希望通过本次专题呈现的生产实践案例,帮助构建可验证、可演进的 Agent 工程体系,推动智能体成为真正可靠的生产系统。
Agent 在生产环境中的应用,因其“模型 + 数据 + 工具链”的复杂黑盒特性,普遍面临故障排查困难、性能优化缓慢、成本与质量难以平衡的挑战。为解决此问题,我们构建了一套从端到端可观测到工程化闭环的 Agent 质量保障体系。方案通过统一探针OneAgent实现从 App/Web/小程序到 AI 网关、Agent、工具乃至 LLM 的全链路 MTL 统一采集,打通了观测数据的孤岛。基于此,我们建立起从观测数据加工与转换、到故障排查与性能优化的工程闭环,实现从埋点到根因的快速定位。同时,观测数据的回流与离线/在线评测、Agent 轨迹评测相结合,驱动了 Agent 的持续改进与成本优化,为 Agent 的可靠、高效、经济运行提供坚实保障。
演讲提纲
1. 背景与挑战:当 Agent 遇上生产环境
2. 端到端可观测
3. 统一与预置:提升可观测性平台的工程效率
4. 数据回流与评测:Agent 的质量保障体系
5. 总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
2025 年,Qwen/Deepseek 等为代表的开源模型能力接近闭源模型,vLLM/SGLang 等为主流推理引擎的飞速进化使得推理成本大幅下降,掀起了全年 Agent 应用的火爆。大模型驱动的推理链路,呈现出多语言,异构技术栈等复杂特性,原有的微服务可观测体系存在明显盲区,全链路全栈可观测性面临巨大挑战。对于链路中关键节点推理引擎,传统请求粒度的 Trace 无法下探 Token 粒度生成过程,让引擎相关的性能优化以及生产稳定性定位困难重重。在此背景下,蚂蚁可观测团队率先构建了业界首个覆盖全链路、全栈、Token 级的深度可观测体系,将可观测性从宏观请求下沉至微观 Token 维度,实现对推理全过程的白盒化透视。我们不仅实现了对每个 Token 生成过程及候选概率分布的精细化观测,还创新地引入多请求并发分析能力,分析多租户请求间的干扰。该体系已在生产大规模稳定运行,观测开销控制在千分点,问题定位效率提升 10 倍以上,填补了社区空白。本次演讲我将系统分享我们在大模型推理可观测性领域的前沿探索与工程实践,涵盖核心架构设计、关键技术突破、典型场景案例及未来演进方向,为行业构建下一代 AI 基础设施提供可复用的方法论与技术参考。
演讲提纲
1. 大模型时代 - 可观测性面临范式重构
2. 从业务到引擎 - 全栈全链路架构与核心技术
3. 引擎显微镜 - Token 级深度可观测
4. 引擎广角镜 - 多请求并发分析
5. 社区贡献:覆盖三大主流引擎,形成 Trace 统一可观测标准
6. 总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
深入引擎内部埋点,覆盖多个主流引擎/异构硬件,维护成本较高。
演讲亮点
业界首个覆盖多引擎、Token 级的深度可观测 Trace,将可观测性从宏观请求下沉至微观 Token 维度,实现对引擎内部 Token 生产过程的白盒化透视。在生产环境大规模运行,实时采集,观测开销控制在千分点。
听众收益
Agent 在生产环境中的应用,因其非确定性推理与动态工具交互的特性,普遍面临质量难以量化、问题发现滞后、优化方向不明确的挑战。一个案例是:某旅游搜索 Agent 用户参与度下降 15%,传统监控显示所有技术指标正常,但用户体验持续降级长达 7 周才被发现和修复。根本原因在于缺乏系统化的评估体系。
为解决此问题,我们构建了一套从离线评测到在线监控的 Agent 评估工程体系。通过 Ground Truth + LLM-as-Judge 的混合评估范式,覆盖从单次响应到完整会话的多层次评估;建立能力评估 → 回归评估 → 生产监控 三阶段演进路径,将评估融入从开发到生产的全生命周期;结合可观测性数据实现自动化采样评估,从" 4 周发现问题 + 3 周修复"缩短到" 2小时发现 + 1 天修复"。同时,通过评估任务设计的最佳实践、非确定性处理方法(pass@k/pass^k)、以及评估器校准机制,为 Agent 的可靠、高质量运行提供坚实保障。
演讲提纲
1. 开场:从"盲目调优"到"数据驱动"
2. Agent 评估的本质挑战
3. Agent 评估工程的方法论
4. 工程实践与落地路径
5. 总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
随着 AI Agent 在小红 ToC、ToB 以及内部平台场景的规模化落地,传统 DevOps 体系面对 Agent 已经开始”水土不服“,Agent 的故障模式从”异常型“转型向”漂移型“,可用性和效果劣化问题并存,有可能可用性监控一切绿灯,但是用户体验逐渐下降。其根本原因在于 Agent 的变更单元从单一代码扩展为 Prompt、Model、Skill/Tool、Knowledge 等多种组合,任意维度的变化都可能引发效果的不可预期波动,而传统的监控、测试手段难以有效覆盖。
为此,我们需要构建一个面向生产的 AgentOps 工程体系,聚焦解决三类核心问题:Agent 如何从黑盒转向可控、工程迭代的闭环问题、线上效果的观测与持续优化。在 AI 应用观测的基础上,我们建设了以评估为中心的可靠性体系,通过离线+在线双轨评估,实现上线变更的自动化拦截,并针对不同业务场景建立从线上 Good/Bad Case 自动回流到评测数据集的机制,形成迭代与验证的正循环。
本次分享我会结合小红书在 AgentOps 领域解决的痛点问题,详细分享其中的工程落地实践,希望能给听众带来一些启发和思考,欢迎多多交流。
演讲提纲
1. 为什么需要 AgentOps
2. 面向 Agent 的可观测性体系建设
3. AI 应用评估在不同业务场景的建设和落地
4. 未来规划
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
当我们将 Agent 从原型推向核心生产系统时,真切遇到了传统软件体系无法解决的落地难题:Agent 的非确定性推理、动态工具交互形成了 “语义黑盒”—— 故障发生时查不到决策断层、优化时缺细粒度数据、多 Agent 协同后复杂度失控。更关键的是,QPS、延迟等传统指标根本无法衡量 “任务能不能成、决策合不合理”。我们在多个重要业务场景中踩过服务不稳定、质量漂移、成本超支的坑,最终意识到:必须针对 Agent 特性,从可观测和评估两个维度搭建落地保障体系。本次分享将复盘阿里云对内对外多业务场景的实践经验 —— 如何从 0 到 1 构建可落地的观测与评估方案,破解 Agent 生产落地的核心困局。
演讲提纲
1. 从原型到生产,我们踩过的 3 类核心坑
2. Agent 可观测体系生产落地全流程实践
3. Agent 评估体系从 0 到 1 搭建与闭环优化
4. 案例分享:阿里云内部落地实践案例
5. 实践反思与未来探索
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收获
当 Agent 从"能用"走向"好用",强化学习(RL)成为关键路径——但 AI Agent 的执行链路正在变得前所未有的复杂——LLM 推理产生意图,Agent 框架编排决策,沙箱平台调度容器,运行时执行系统调用——但现有的可观测工具只能看到其中的碎片。APM 看到 HTTP 请求,K8s 看到 Pod 生命周期,日志系统记录文本片段,没有任何一个方案能回答最核心的问题:"Agent 想做什么?实际做了什么?结果怎样?"
本次演讲将分享我们如何基于 eBPF 构建覆盖"LLM → Agent → 沙箱平台 → 运行时"全链路的无侵入式可观测体系。eBPF 工作在内核层,天然穿透所有基于容器的沙箱实现,不需要 Agent 修改一行代码,不需要沙箱预装任何组件。我们将完整展示这套体系如何打通四个观测层:在 LLM 层还原每次对话的 Token 消耗与延迟;在 Agent 层关联意图与行为;在沙箱平台层通过审计日志与运行时事件的时空关联建立完整 Trace;在运行时层捕获每个命令的 Stdio、退出码和资源消耗。所有数据通过 OTLP 标准协议输出,可直接接入 Jaeger、Grafana 等现有可观测基础设施,同时为 RL 训练提供结构化的 Reward Signal。
演讲提纲
1. 为什么 Agent 需要一种全新的可观测方案
2. 深度感知:构建 Agent 执行的"全息画像"
3. 打通全链路:从 LLM 对话到内核 Syscall 的完整视图
4. 数据交付:标准化输出与业务赋能
5. 总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
目前可观测实践多停留在运行态(指标/日志/链路)层面,能发现异常,却难以快速回答“为什么发生、回滚哪个变更、改哪段代码”。本演讲以腾讯 IEG 的蓝鲸可观测平台实践为背景,提出并落地“Code + Change + Runtime”的全链路可观测实践:打通 CI/CD、PR/Commit 与运行态信号;在同一份数据流之上,分别为运维、运营、管理者构建差异化SaaS 应用;并引入 AI 的代码理解能力,将定位与代码及变更进行关联,实现真正的根因定位,并利用平台实现更多的 AI 提效场景。
演讲提纲
1. 为什么观测平台要做 PaaS 化, 如何打通从研发过程到代码,再到最后的生产环境
2. 如何在 PaaS 化平台上构建面向 SRE、运营与管理者三大场景
3. 从日志告警到代码级根因分析的解决方案
4. 其他 AI + 观测提效场景
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

