在技术迅猛发展的今天,软件系统的稳定性和可靠性已成为互联网公司的生命线。近年来,... 展开 >





党受辉,腾讯 IEG 技术运营部助理总经理,专家工程师。腾讯游戏 SRE 负责人,负责研发工具链、运维自动化、线上可靠性等研运一体基础设施平台蓝鲸智云;信通院 SREelite《SRE 实践白皮书》作者之一。
在技术迅猛发展的今天,软件系统的稳定性和可靠性已成为互联网公司的生命线。近年来,多家知名互联网公司遭遇的软件系统故障,不仅影响了用户体验,也暴露了在可靠性工程和业务连续性规划方面的不足。这些事件促使服务提供商、用户及整个行业开始深刻反思,并加强在这些领域的投入和改进。
软件系统的稳定性问题不仅给用户带来不便,还可能导致企业声誉和经济损失。随着对服务质量要求的提高,线上可靠性工程逐渐成为互联网公司的核心竞争力之一。
线上可靠性工程是代码发布到生产环境之后的技术运营过程,是代码产生使用价值的环节,很多公司的 SRE 工程师会围绕这个环节展开各类工作,例如 SLI/SLO 管理、故障应急、用户体验优化、618之类的重大节点技术保障、容量管理及成本优化、混沌工程、综合算力调度、业务全生命周期工具建设等。
如果线上可靠性工程出现问题,那么前期在应用产品设计、研发测试、发布变更等环节的所有投入都可能变得毫无意义。
本专题将从 SRE 视角保障业务线上可靠性为出发点,邀请不同公司的稳定性技术专家,分享他们在各自的业务场景中的可靠性/ 稳定性保障的实践经验,共同探讨线上可靠性工程的问题的解决思路。
除了从架构、容灾、监控的角度提升可靠性之外,用户体验的波动也影响着用户对线上系统稳定性和可靠性的感知。在全球网络环境下,云服务商众多,网络延迟多变,成本计算复杂,影响因素难料,单纯依赖人的选择应用的部署节点,已经不能完全满足业务在用户体验方面的要求。
腾讯游戏 SRE 团队,利用 AIOPS 能力,从数据工程角度,通过分析全球网络数据,云服务商数据,用户访问模拟等方式,建立一套用户体验评价体系,找到了一种相对通用的全球网络环境下的用户体验优化实践方案,为海外业务发展提供关键决策。这是一套实践方案不仅适用于游戏行业,也同样适用于其他互联网行业的用户体验优化方案。
演讲提纲
1. 真实的全球网络环境到底什么样?
2. 腾讯游戏全球网络环境优化实践
3. 非游戏业务的应用实践
4. 经验总结和未来展望
实践痛点
演讲亮点
听众收益
线上故障到底是什么?谁应该为线上稳定性负责?如何评价应急过程到底是做的好还是不好?
近年来国内外多家知名公司都出现过重大故障,线上可靠性变得越来越重要,同时由于不同公司的主营业务、企业性质、公司规模等差异较大,稳定性保障思路和落地方案也是百花齐放。但有一些最核心、最本质的问题还是急需被定义和讨论清楚。
本次分享主要介绍蚂蚁的故障应急体系,通过实际的故障案例来简要介绍故障定义、组织阵型、平台能力、应急流程、应急评价等内容,并分享 AIOPS、LLM 大模型等能力在应急定位中的落地情况,以期能够回答业务稳定性保障要“做什么”、“谁来做”、“怎么算做得好”等问题,希望能给大家带来一些新的保障思路。
演讲提纲
1. 引子:一个真实的线上故障
2. 蚂蚁故障体系构建
3. 蚂蚁应急体系构建
4. 一个线上故障的全生命周期
5. 未来已来
实践痛点
演讲亮点
听众收益
在 AI 浪潮冲击之下,很多 IT 企业的 SRE 团队都在尝试落地 AIOps,通过 AI 进行运维流程洞察、AI 辅助运维决策、AI 自动根因分析等,提升 SRE 工作效率,进而提升网站稳定性。越来越多的 IT 企业选择云原生架构进行系统部署,交付和运维管理效率得到了提升。但这也致使系统的可观测体系变得越来越复杂,监控和日志数据膨胀的速度也远超大家的预期。可观测性数据的三剑客(Metrics、Tracing、Logging )是 SRE 工程师处理监控、告警、问题排查等需求的重要依赖。如果说标准化是自动化运维流程落地的压舱石、那么可观测性数据的质量就是 AIOps 落地的最重要拼图,没有高质量运维监控数据,AIOps 只能停留在纸上谈兵。
本次演讲主要携程对内部可观测平台进行架构升级的工程实践,涵盖 Metric 和 Logging 数据进行统一治理、为 AIOps 落地提供数据和工具支撑;最后会介绍云平台团队通过使用 AI 工具来提升平台运维效率的真实案例,希望能给大家带来一些帮助。
演讲提纲
1. 携程可观测性平台现存问题
2. 数据治理实践
3. 升级架构助力 AIOPS 落地
4. 实践案例与展望
演讲亮点
实践痛点
听众收益
近两年,随着企业降本增效的持续深化,企业 IT 服务的稳定性受到了一定的冲击,这点从微博热搜上也能初见端倪。如何确保过往企业在服务高可用、业务多活和基础架构容灾等方面的投入是真实有效的,当保障故障和灾难来临时,业务连续性不受过重损失?这是当下诸多公司面临的一大挑战。
本次分享将从 B 站的容灾演练体系构建入手,逐步拆解体系,带大家深入了解 B 站在容灾演练上的组织阵型搭建模式、运营机制设定方法以及容灾产品能力建设,最后通过结合业务实践为大家展示 B 站是如何通过容灾演练体系来支撑业务多活、大促保障和研发质量交付等多个环节的,希望能为大家带来一些稳定性保障的新思路。
演讲提纲
1. 新形式下的稳定性挑战
2. 轻量级容灾演练体系构建
3. 业务场景实践
4. 总结展望
实践痛点
演讲亮点
轻量级的容量演练体系设计思路和实践参考
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

