大模型赋能 AIOps

会议室:汉宫+明宫
出品人:柯旻

借助大模型强大的涌现能力和推理能力,AIOps 解决海量以及复杂的业务架构下的异... 展开 >

专题出品人:柯旻

字节跳动基础架构 SRE 负责人

字节跳动基础架构 SRE 负责人,负责整体字节跳动基础架构全球相关基础设施,以及组件产品的稳定性、成本优化、运维产品开发、智能运维等相关工作。

地点:汉宫+明宫

专题:大模型赋能 AIOps

借助大模型强大的涌现能力和推理能力,AIOps 解决海量以及复杂的业务架构下的异常问题将事半功倍。本专场将邀请来自不同行业的 AIOps 实践者,分享他们如何在各自的业务场景中将大模型接入 AIOps 解决实际业务问题。帮助运维团队更好的理解系统行为,预测潜在问题,在自动化日志分析,故障诊断,成本优化,事件管理等方向提供智能化的决策支持。

by 王宁

抖音
算法工程师

随着信息技术和大数据的发展,企业在日常运维管理中面临越来越复杂的挑战。传统的 AIOps 系统依赖于规则和模式识别,但常常由于知识库的局限性和缺乏灵活的智能决策支持,无法高效处理快速变化的故障场景。大语言模型(LLM)凭借其跨任务的智能能力,逐渐展现出在运维领域中的巨大潜力,尤其在跨系统的知识整合、故障处理以及自动化决策方面,具备了比传统技术更高的灵活性和智能化水平。

然而,大语言模型本身的挑战也不容忽视。由于其训练依赖于公开的互联网数据,LLM 通常缺乏针对私有领域、特定行业或企业的知识积累。这意味着,虽然 LLM 能够在通用场景中表现出色,但在处理企业的私有化、专有知识时,常常表现出知识盲区或无法精准适配的情况。为此,如何将企业内部丰富的私域知识与 LLM 的智能能力结合,成为了智能运维技术发展的关键瓶颈。

本次演讲将介绍如何通过创新的知识沉淀、学习、生成与更新机制,将私域知识与 LLM 深度融合,构建更加智能和自主的运维系统。我们将展示 SOPAgent 这一全新架构,如何解决传统 AIOps 中遇到的难题,通过大语言模型的自主学习能力,让企业能够高效、智能地处理复杂的运维场景,从而大幅提升运维效率与准确性。

演讲提纲

1. 业务背景与挑战

  • LLM 在 AIOps 中的优势与挑战
  • 私域知识的沉淀与使用难题

2. 技术方案与创新

  • 知识沉淀:自动化收集与整合私域知识,处理多模态数据
  • 知识学习:基于 LLM 的自动学习与组织
  • 知识生成:自动化生成(混沌工程)与业务需求对接
  • 知识更新:智能化迭代与持续学习

3. SOPAgent 架构设计

  • 知识收集与处理阶段
  • 知识生成与应用阶段

4. 技术亮点与创新

  • 多模态大模型的应用
  • LLM 的推理与知识抽取能力
  • 知识生成与验证的闭环
  • 自动化与智能化的运维提升

5. 实践效果与案例分享

  • SOPAgent 在实际运维中的应用效果
  • 故障处理与知识生成的实际案例展示
  • 系统如何提升运维效率与准确性
  • 客户反馈与应用成果
  • 企业运维人员如何利用 SOPAgent 提高工作效率
  • 智能化运维对公司整体生产系统的影响

6. 经验总结与建议

7. 未来展望与发展方向

您认为,这样的技术在实践过程中有哪些痛点?

  • 多模态数据的处理
  • RAG 系统的搭建
  • LLM 能力的局限

演讲亮点

  • 智能 Agent 的自主学习能力:LLM 如何从私域知识中自主学习、生成 Agent,减少业务人员的直接参与
  • 多模态数据的智能处理:如何有效整合图像、文本等多种形式的私域数据,提升知识的应用效果
  • 闭环的知识管理体系:知识的自动收集、学习、生成与更新,推动智能化运维的不断发展

听众收益

  • 了解如何通过 LLM 优化私域知识管理和运维流程
  • 掌握基于 LLM 的智能 Agent 开发与运维知识管理最佳实践
  • 获取提升运维效率和准确性的技术方案与实践经验

by 张颖莹

阿里云
算法专家

异常处置包含异常发现、问题定界和根因定位等环节,一个高效的异常处置流程对于保障平台的稳定性起到至关重要的作用。然而平台本身的复杂度以及海量的多元异构数据给异常处置带来了巨大的挑战,大模型等 AI 技术的演进则为应对这些挑战提供了新的思路。本次演讲将从阿里云计算平台的运维场景出发,分享从异常发现到问题定界和根因定位各环节的算法选型和设计思路,包括通用的时间序列异常检测、高效的日志聚类和精准的多 Agent 根因定位框架。

演讲提纲

1. 阿里云大数据运维背景

  • 阿里云大数据 & AI 平台介绍
  • 异常处置面临的核心挑战

2. 通用异常发现和定界

  • 通用时间序列异常检测
  • 基于下钻和日志聚类的问题定界

3. 多 Agent 根因定位框架

  • Agent 角色设定
  • 工具箱建设
  • 多 Agent 工作流编排

4. 通用异常处置平台构建

  • 大模型应用部署框架
  • 异常处置平台建设
  • 线上应用效果

5. 总结和展望

您认为,这样的技术在实践过程中有哪些痛点?

大模型多 Agent 框架中,用工具的方式整合了算法小模型和运维业务分析工具,这些工具本身的性能和精度,对于大模型最终的推断效果起到关键作用。同时多 Agent 框架本质上实现了复杂任务的拆解,相较于单 Agent 框架会进行更多次的推理,适用于较复杂的平台

演讲亮点

  • 异常发现部分的算法设计充分考虑了运维场景中关注典型异常类型,具备通用性和高性能。相关论文被顶会 SIGMOD/KDD 等接收。同时利用问题定界能力对异常发现结果进行过滤,可以实现有效的告警降噪
  • 根因定位部分采用的大模型多 Agent 框架,基于平台模块进行 Agent 角色的设定,可以模拟出现实世界中不同模块专家协同定位的场景, 同时在每个 Agent 内部整合了算法小模型和运维业务分析工具,增强了结果的可靠性

听众收益

  • 通过阿里云计算平台的实践经验和案例,听众可以了解在 AI 如何赋能运维场景中非常核心的异常处置流程
  • 本次分享介绍的算法框架,已经被国际顶会接收,具备技术前沿性,通过分享观众可以了解框架的技术细节
  • 通过未来展望,听众可以了解智能运维未来发展的趋势和需要攻破的难题

by 熊训德

腾讯
专家工程师

在大数据平台高速发展的当下,生态扩张与业务量激增,致使大数据分布式组件问题愈发棘手,传统专家运维模式捉襟见肘。以腾讯大数据庞大的规模为例,面对海量计算单元、繁杂技术栈以及千万级任务管理,借助 AI 驱动实现大数据系统的故障和问题的快速洞察与自治能力,已成为行业迫切需求。

本次演讲我将介绍如何通过可拔插的决策引擎、以及数据专家自治智能体构建大数据智能管家,让企业能够理解如何高效、智能地处理复杂的运维场景,从而大幅提升大数据场景下运维效率与准确性,引领大数据线上系统迈向全面自治的新征程。

演讲提纲

1. 开源大数据系统运维背景与挑战

  • 大数据自治决策对实时性要求和挑战
  • 错综复杂的大数据存储、计算、调度技术栈对根因分析决策引擎挑战
  • 传统专家系统对构建复杂大数据自治系统的局限分析

2. 大数据智能管家技术框架及关键实现路径

  • 可拔插的智能决策引擎思考和设计
  • 基于腾讯云大数据海量专家知识库构建的自治智能体
  • AI 驱动的智能洞察及通用大模型对构建复杂大数据自治系统的分析和构建

3. 实践效果与案例分享

  • 不同数据量场景下大数据智能自治的具体决策路径及效果
  • 分享在大数据存储和调度在故障场景下的自优化过程

4. 探讨大数据智能管家经验和教训

  • 稳定性:数据质量对构建自治智能体稳定性的影响及优化
  • 安全性:决策系统应对数据安全的相关教训和思考

5. 探讨智能管家未来发展方向与潜在影响

  • 大模型在大数据运维应用的趋势
  • 大数据智能持续优化与创新的路径

您认为,这样的技术在实践过程中有哪些痛点?

  • 可拔插的决策引擎思考和设计
  • 构建复杂大数据自有知识库的自治智能体
  • AI 驱动的智能洞察和自治系统的分析和构建

演讲亮点

  • 可拔插的智能决策引擎:结合大数据庞杂组件现状,创新性设计了可拔插的决策引擎,同时具备通用性和高效率
  • 大数据智能运维深入思考及实践路径:系统分析了大数据运维智能化在腾讯真实碰到的问题和解决,推动大数据智能化运维及自治的不断发展

听众收益

  • 了解大数据系统运维发展当前的困境和挑战
  • 掌握基于通用大模型怎么结合大数据专有知识库和自治智能体,构建大数据专有自治系统
  • 获取提升大数据系统运维高效而准确性的技术方案与实践经验

交通指南

北京石景山万达嘉华酒店

Wanda Jin
地址:北京市石景山区石景山路甲18号院
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手