随着云原生、多云架构、大语言模型(LLM)的爆发式发展,企业系统复杂度呈指数级增... 展开 >








阿里云可观测技术架构负责人,高级技术专家,在可观测数据采集、存储分析、全栈可观测应用、AIOps 等多个领域均有丰富领导经验,相关系统历经数十万企业以及阿里内部多次双十一考验。目前主要研究方向为大模型可观测及应用、AIOps、下一代可观测数据技术。
随着云原生、多云架构、大语言模型(LLM)的爆发式发展,企业系统复杂度呈指数级增长,传统可观测技术面临海量数据实时分析、跨模态数据整合、问题发现即时度、根因定位效率等挑战。与此同时,LLM 的推理能力与生成式 AI 的数据理解能力,为可观测技术(尤其是 AIOps )的演进提供了全新思路。另一方面,可观测技术也在反哺 AI 领域:模型训练需要可观测性保障资源效率与稳定性,LLM 应用落地依赖实时监控以优化性能与用户体验。
本专题将围绕 AI 与可观测技术的双向赋能,讨论如下方面的问题:
通过本专题探讨,希望为听众带来以下核心价值:
大模型 Agent 在智能运维场景落地时常常遇到“做 demo 容易,泛化难”的问题。借鉴编程智能体中可验证环境的成功经验,我们构建了智能运维领域的可验证实验环境和高质量评测集。阿里云可观测团队对云原生应用的运行态进行了详尽的理论建模,构建了覆盖 APM/容器/云服务/操作系统/LLM 应用等领域的实验环境,设计了全面的故障注入机制,并在此基础上制作了大规模高质量的评测集。
本次分享我将介绍这个实验环境并发布评测集,深入探讨如何利用评测集验证并提升基于 Agent 的智能运维算法泛化性。
演讲提纲
1. 智能运维泛化之痛
2. 智能运维领域的评测集介绍
3. 如何构建高质量的评测集
4. 基于评测集的智能运维 Agent 能力提升实践
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
近年来,AI 技术发展迅猛,相关产品和解决方案已深入社会经济的方方面面,成为驱动创新、提升效率的重要引擎,AI 应用的其可观测技术也成为了行业关注的一个焦点,Prometheus 作为云原生监控领域事实标准,被广泛应用于 AI 大模型和智能驾驶领域的可观测任务,用于实现最佳性能及减少故障。本次演讲我将分享火山引擎托管 Prometheus 在服务 AI 领域客户(如火山方舟)过程中,积累的保障 AI 推理服务时序数据库稳定性的关键技术实践,希望能给听众带来一些启发和思考。
演讲提纲
1. 大模型场景指标观测需求和挑战
2. 新时代下 Prometheus 核心演进思路
3. 火山引擎托管 Prometheus 优化实践
4. 大模型场景实战效果
5. 未来与展望
实践痛点
听众受益
短视频平台自然流量与广告流量的传输链路,存在链路长、跨时序、在离线架构的特点,研发苦于“捋不清业务”、“看不清链路”,广告曝光与转化链路的异常归因复杂度极高,传统运维面临业务指标与系统链路脱节的核心瓶颈。通过 AI 驱动,构建了快手电商、商业化和本地业务的公司级链路可观测平台。基于报文异动巡检、数据异动巡检、指标拓扑巡检的行业创新的链路巡检工具,实现百维字段组合归因与千亿级报文的多 LoRA 高效微调。本次分享我将系统分享数据壁垒破解路径与模型幻觉的准召率取舍逻辑,沉淀从报文分析到决策博弈的多个关键场景实战经验,为行业提供经过千亿级流量验证的可观测技术落地经验参考。
演讲提纲
1. 广告曝光与转化链路的复杂性与问题排查难度
2. 从人工梳理到模型生成,公司级业务链路的梳理落地方案
3. 通过大模型进一步提高链路问题召回质量
4. 经验总结与建议
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
研发与 SRE 团队日常工作中,主要被三类任务消耗大量时间:半夜因告警被叫醒、反复查询指标日志及排障分析、撰写复盘总结报告。传统自动化及 AIOps 实践虽然在一定程度上缓解了部分环节的问题,但由于知识难以结构化复用、工具体系分散,导致难以有效融合多源观测数据与专家知识,且难以泛化应用于多样化场景。我们提出基于大语言模型(LLM)的“ 告警值守 SRE Agent”,实现告警降噪自动处理、微服务根因定位与个性化分析,最终生成值守报告,显著提升运维效率。
演讲提纲
1. 告警值守场景的痛点、挑战和 Agent 的价值
2. 搭建 SRE Agent, 遇到的三大挑战
3. SRE Agent 平台架构的“四横四纵”设计
4. 初步实践:基于 Agent 的告警降噪实现
5. “5A”行动计划:从 RCA Copilot 到自主分析与行动适应 Agent
6. 总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
在支撑 bilibili 亿级用户的复杂分布式系统中,一次故障可能涉及数百个微服务的连锁反应。传统的人工排查方式面临着"大海捞针"的困境,平均 MTTR 往往在小时级别。而 AI 技术的突破为这一问题带来了全新解法。我们构建了智能化根因分析系统,实现了从"被动响应"到"主动诊断"的转变,将工程师从重复性排查工作中解放出来。本次分享我将深入剖析 bilibili 在 AI 驱动的智能运维领域的核心技术实践,包括多模态数据融合、知识图谱构建、大模型推理优化等关键技术,为听众提供可落地的 AI + 可观测性解决方案。
演讲提纲
1. 从"人肉排查"到"AI诊断":bilibili 的痛点与机遇
2. 根因分析核心架构和演进思路
3. 核心场景的 AI 化改造实践
4. 技术演进方向与实践展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
AI 技术的爆发式增长对可观测性的挑战和新需求:如何保障 AI Infra 和 AI 应用的稳定性、性能和可靠性,可观测平台也从“服务业务”到“服务 AI ”再到“自身智能化”的演进趋势。AI 正在重塑可观测平台的能力边界:需要对 AI 基础设施、训练/推理有一定了解,才能提供真正有效的可观测能力;从传统的数据呈现/检索工具,变成具备洞察力和决策辅助能力的智能系统。本次分享我会结合小红书在 AI 领域不同方向解决痛点问题的经验探索,详细分享其中一些重点技术的实践和落地,希望能给听众带来一些启发和思考,欢迎多多交流。
演讲提纲
1. 小红书可观测在 AI 时代面临的挑战
2. AI Infra 观测:稳定性体系建设
3. AI 应用观测:全链路监控的落地实践
4. 可观测 AI Agent 场景建设与落地
5. 未来规划
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
随着服务架构的演进,可观测性解决方案也在持续发展。在分布式系统可观测性技术还未完全成熟时,大模型的兴起又对可观测性提出了新的技术要求,并催生了创新的实践方法。本次演讲我将首先回顾小米可观测性技术的发展历程,随后深入分享可观测性在 AI 基础设施建设中的多项解决方案与实践案例,包括集群快速交付、多机房高可用架构、网络监控与故障自愈等关键技术领域的应用实践。
演讲提纲
1. 现状与挑战
2. 可观测在 AI 基础设施的落地方案
3. AIOps 探索落地
4. 展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

