具备多年互联网行业以及业务领域架构设计经验,目前聚焦阿里云 APM & AI 可观测领域,主要从事可观测产品 ARMS & CMS 的研发、设计与布道,具备丰富的可观测领域技术架构以及实践经验,推进 ARMS 应用性能监控和应用安全(RASP)融合解决方案落地。参与 OpenTelemetry GenAI 开源社区生态,关注大语言模型领域可观测技术架构演进,探索支持 AI 应用层到底层基础设施的全栈可观测能力解决方案以及最佳实践。

具备多年互联网行业以及业务领域架构设计经验,目前聚焦阿里云 APM & AI 可观测领域,主要从事可观测产品 ARMS & CMS 的研发、设计与布道,具备丰富的可观测领域技术架构以及实践经验,推进 ARMS 应用性能监控和应用安全(RASP)融合解决方案落地。参与 OpenTelemetry GenAI 开源社区生态,关注大语言模型领域可观测技术架构演进,探索支持 AI 应用层到底层基础设施的全栈可观测能力解决方案以及最佳实践。
当我们将 Agent 从原型推向核心生产系统时,真切遇到了传统软件体系无法解决的落地难题:Agent 的非确定性推理、动态工具交互形成了 “语义黑盒”—— 故障发生时查不到决策断层、优化时缺细粒度数据、多 Agent 协同后复杂度失控。更关键的是,QPS、延迟等传统指标根本无法衡量 “任务能不能成、决策合不合理”。我们在多个重要业务场景中踩过服务不稳定、质量漂移、成本超支的坑,最终意识到:必须针对 Agent 特性,从可观测和评估两个维度搭建落地保障体系。本次分享将复盘阿里云对内对外多业务场景的实践经验 —— 如何从 0 到 1 构建可落地的观测与评估方案,破解 Agent 生产落地的核心困局。
演讲提纲
1. 从原型到生产,我们踩过的 3 类核心坑
2. Agent 可观测体系生产落地全流程实践
3. Agent 评估体系从 0 到 1 搭建与闭环优化
4. 案例分享:阿里云内部落地实践案例
5. 实践反思与未来探索
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收获



微信咨询

电话咨询
微信联系我们

