借助大模型强大的涌现能力和推理能力,AIOps 解决海量以及复杂的业务架构下的异... 展开 >




字节跳动基础架构 SRE 负责人,负责整体字节跳动基础架构全球相关基础设施,以及组件产品的稳定性、成本优化、运维产品开发、智能运维等相关工作。
借助大模型强大的涌现能力和推理能力,AIOps 解决海量以及复杂的业务架构下的异常问题将事半功倍。本专场将邀请来自不同行业的 AIOps 实践者,分享他们如何在各自的业务场景中将大模型接入 AIOps 解决实际业务问题。帮助运维团队更好的理解系统行为,预测潜在问题,在自动化日志分析,故障诊断,成本优化,事件管理等方向提供智能化的决策支持。
随着信息技术和大数据的发展,企业在日常运维管理中面临越来越复杂的挑战。传统的 AIOps 系统依赖于规则和模式识别,但常常由于知识库的局限性和缺乏灵活的智能决策支持,无法高效处理快速变化的故障场景。大语言模型(LLM)凭借其跨任务的智能能力,逐渐展现出在运维领域中的巨大潜力,尤其在跨系统的知识整合、故障处理以及自动化决策方面,具备了比传统技术更高的灵活性和智能化水平。
然而,大语言模型本身的挑战也不容忽视。由于其训练依赖于公开的互联网数据,LLM 通常缺乏针对私有领域、特定行业或企业的知识积累。这意味着,虽然 LLM 能够在通用场景中表现出色,但在处理企业的私有化、专有知识时,常常表现出知识盲区或无法精准适配的情况。为此,如何将企业内部丰富的私域知识与 LLM 的智能能力结合,成为了智能运维技术发展的关键瓶颈。
本次演讲将介绍如何通过创新的知识沉淀、学习、生成与更新机制,将私域知识与 LLM 深度融合,构建更加智能和自主的运维系统。我们将展示 SOPAgent 这一全新架构,如何解决传统 AIOps 中遇到的难题,通过大语言模型的自主学习能力,让企业能够高效、智能地处理复杂的运维场景,从而大幅提升运维效率与准确性。
演讲提纲
1. 业务背景与挑战
2. 技术方案与创新
3. SOPAgent 架构设计
4. 技术亮点与创新
5. 实践效果与案例分享
6. 经验总结与建议
7. 未来展望与发展方向
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
异常处置包含异常发现、问题定界和根因定位等环节,一个高效的异常处置流程对于保障平台的稳定性起到至关重要的作用。然而平台本身的复杂度以及海量的多元异构数据给异常处置带来了巨大的挑战,大模型等 AI 技术的演进则为应对这些挑战提供了新的思路。本次演讲将从阿里云计算平台的运维场景出发,分享从异常发现到问题定界和根因定位各环节的算法选型和设计思路,包括通用的时间序列异常检测、高效的日志聚类和精准的多 Agent 根因定位框架。
演讲提纲
1. 阿里云大数据运维背景
2. 通用异常发现和定界
3. 多 Agent 根因定位框架
4. 通用异常处置平台构建
5. 总结和展望
您认为,这样的技术在实践过程中有哪些痛点?
大模型多 Agent 框架中,用工具的方式整合了算法小模型和运维业务分析工具,这些工具本身的性能和精度,对于大模型最终的推断效果起到关键作用。同时多 Agent 框架本质上实现了复杂任务的拆解,相较于单 Agent 框架会进行更多次的推理,适用于较复杂的平台
演讲亮点
听众收益
在大数据平台高速发展的当下,生态扩张与业务量激增,致使大数据分布式组件问题愈发棘手,传统专家运维模式捉襟见肘。以腾讯大数据庞大的规模为例,面对海量计算单元、繁杂技术栈以及千万级任务管理,借助 AI 驱动实现大数据系统的故障和问题的快速洞察与自治能力,已成为行业迫切需求。
本次演讲我将介绍如何通过可拔插的决策引擎、以及数据专家自治智能体构建大数据智能管家,让企业能够理解如何高效、智能地处理复杂的运维场景,从而大幅提升大数据场景下运维效率与准确性,引领大数据线上系统迈向全面自治的新征程。
演讲提纲
1. 开源大数据系统运维背景与挑战
2. 大数据智能管家技术框架及关键实现路径
3. 实践效果与案例分享
4. 探讨大数据智能管家经验和教训
5. 探讨智能管家未来发展方向与潜在影响
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

