SRE的 “狂飙” 之路

会议室:秦宫
出品人:党受辉

在数字化浪潮中,系统稳定是企业发展的基石,本专题将深度复盘 SRE 团队如何在复... 展开 >

专题出品人:党受辉

腾讯 IEG技术运营部助理总经理,专家工程师

党受辉,腾讯 IEG 技术运营部助理总经理,专家工程师。腾讯游戏 SRE 负责人,负责研发工具链、运维自动化、线上可靠性等研运一体基础设施平台蓝鲸智云;信通院 SREelite《SRE 实践白皮书》作者之一。

地点:秦宫

专题:SRE的 “狂飙” 之路

在数字化浪潮中,系统稳定是企业发展的基石,本专题将深度复盘 SRE 团队如何在复杂多变的技术环境中,一路 “狂飙”,实现系统稳定性的飞跃。

本专题将涵盖:监控观测体系设计、故障应急体系搭建、混沌实验及故障预防等实践,还会有一线 SRE 专家分享实战中惊心动魄的 “战斗” 故事,讲述如何在关键时刻力挽狂澜,保障业务的持续运转。

通过本专题,听众将能够深入了解 SRE 的核心实践与创新方法,学习如何在自身组织中落地 SRE,提升系统的可靠性与运维效率。同时,丰富的实战案例和经验分享将帮助听众更好地应对实际工作中的挑战,推动运维体系的持续优化与演进。无论你是 SRE 领域的新手,渴望汲取经验快速成长,还是资深从业者,期待交流前沿理念,都能在这场分享中收获满满。

by 梅利民

百度
资深运维工程师

在云原生技术快速迭代的背景下,质量保障面临诸多挑战,如质量标准缺乏量化、质量能力退化以及相同风险、故障重复发生等问题。这些问题不仅影响系统的稳定性,也增加了业务风险。本次分享将介绍百度如何通过“数字免疫”概念构建可持续的高质量保障体系,探讨通过质量能力数字化、产品规模化和智能增强三大路径,帮助团队系统性提升质量保障能力,希望能为其他企业提供一些参考。

演讲提纲

1. 背景与机遇

  • 云原生趋势下质量保障的挑战
  • 数字化免疫能力带来的机遇

2. 基于数字化的免疫建设路径

  • 业界调研与百度自研路径选择
  • 实现路径:数字化、产品规模化落地及智能化探索

3. 免疫能力系统方案设计

  • 质量能力数字化:五大场景的数字化建模与风险识别
  • 产品化生态构建:统一数仓的灵活编排能力及多方协同共建模式
  • 智能化探索:风险处置的自助化、智能闭环处理探索

4. 数字免疫应用落地实践

  • 统一数仓建设:解决数据标准化量化不足
  • 规则库推广:通过灵活的可组合能力,降低使用门槛,支持业务共建生态
  • 数字化风险治理:风险治理与智能闭环探索

5. 总结与展望

  • 从数字化到数智化免疫系统的核心价值与行业意义
  • AI 时代质量保障能力的持续探索方向

您认为,这样的技术在实践过程中有哪些痛点?

  • 统一数仓的构建仍然存在一定的适配成本、维护成本以及后期的拓展成本
    • 对接(理解)底层不同云产品的数据过程中,需要投入专家人力
    • 随着接入用户和定制化策略增多,统一数仓在未来每一次的结构更新和性能优化都面临较大挑战
  • 产品化开放生态的同时,也面临着大量的“冗余”策略,对策略调优有较大挑战
    • 自定义策略较高的灵活性,在业务接入初期可以带来明显的正向收益;但是随着业务的迭代、人员更替,新旧策略的汰换、历史任务退场等可能影响评估准确性
    • 对于自定义策略,目前暂无较好的通用调优方案;用户想自行维护低冗余策略,减少低效开支,需要投入较大成本

演讲亮点

  • 质量能力保障理念革新:由被动治理转变为协同共建治理,降低理解和使用成本
  • 质量能力治理左移:由被动解决问题到风险治理,规避故障发生

听众收益

  • 了解百度在质量保障领域的数字化转型与智能化实践的工程经验 
  • 了解数字免疫能力在落地过程中的技术点
  • 了解云原生与 AI 时代下质量保障的未来发展方向,为其他企业提供参考

by 付冰尧

小米
手机 IoT 团队 SRE 负责人

智能家居市场近年来高速增长,技术革新与消费升级是主要驱动力。米家作为小米 IoT 业务的核心,已成为全球最大的消费级物联网平台,接入设备达 8.61 亿台,月活用户超 1 亿。由于 IoT 业务的特殊性,运维需同时保障用户和设备的稳定性,且用户对故障的容忍度极低,故障易引发社会关注。

本次演讲将通过米家历史故障案例,介绍近 2-3 年米家是如何通过完善应急保障体系和运维自动化平台,逐步提升业务稳定性,包括业务架构优化、基础组件升级、质量加固经验以及故障预案的制定与实施。

演讲提纲

1. 小米 IoT 业务及架构介绍

  • 业务概况
  • 架构详解

2. IoT 业务质量保障遇到的问题和挑战

  • 用户和设备双侧稳定性保障难题
  • 用户对故障的低容忍与应对压力

3. SRE 的故障应急体系的建设与落地

  • 预警机制
  • 预案管理
  • 关键服务的故障自愈
  • 应急指挥&协作机制
  • 复盘改进

4. 应急案例分享

您认为,这样的技术在实践过程中有哪些痛点?

  • 用户和设备双侧稳定性能力保障能力的建设
  • 自动化运维能力有待提升,后续如何通过 AIOps 能力增强业务稳定性

演讲亮点

  • 全球领先平台的独家经验分享,米家作为全球最大的消费级物联网平台,首次深度揭秘其在 IoT 业务质量保障方面的宝贵经验
  • 故障应急体系建设的方法论结合具体案例,系统性的介绍如何全面提升业务质量

听众收益

  • 深入了解 IoT 业务特性与质量保障精髓
  • 掌握系统性提升业务质量的方法论
  • 探索 IoT 业务与运维系统的平衡之道

by 吴天昊

中国联通软件研究院
副总架构师

在数字化转型的浪潮下,随着云原生技术的不断成熟,企业数字化转型也在不断加速,企业IT架构进入云原生时代,多云多集群部署已经成为常态和趋势,几何增长的云资源、微服务以及复杂化的调用关系与业务场景,传统人肉运维难以为继。如何保障系统的全面稳定,保证业务流程的高效运转,为系统运维提出了不小的挑战。

本次分享将围绕安全生产保障体系建设思路,以及端到端全流程的系统全生命周期稳定性保障工具建设视角,介绍中国联通超大规模IT系统稳定性保障实践经验,希望能为其他企业提供一些参考和帮助。

演讲提纲

1. 背景挑战:超大规模系统的稳定性困局

  • 云原生下系统安全生产面临的挑战
  • 系统应急保障的常见问题痛点

2. 体系能力:应急保障主动防御架构设计

  • 应急保障体系整体解决方案
  • 监控预警与故障诊断
  • 故障调度快速抢通
  • 应急演练主动预防

3. 案例分享:应急保障场景落地实践

  • 故障自愈的经典场景
  • 自动化应急处置案例

4. 总结与展望

  • 应用实施落地效果
  • 未来 AI 大模型赋能

您认为,这样的技术在实践过程中有哪些痛点?

  • 超大规模 IT 系统下的超大数据量处理实时性与告警诊断准确性的平衡博弈
  • 生产运维确定性稳态与 AI 生成式大模型的不确定性的平衡博弈

演讲亮点

  • 技术体系与核心能力结合视角,介绍系统稳定性保障落地思路
  • 结合具体案例,系统性的介绍中国联通超大规模 IT 系统稳定性保障实践

听众收益

  • 深度解读安全生产稳定性保障落地思路,获得可复用的稳定性保障架构设计方法论
  • 获取稳定性保障实战的关键技术细节和踩坑经验,规避共性问题陷阱,了解行业技术演进趋势

by 石鹏

美图
高级运维经理

在 VUCA 时代,IT 系统日趋复杂、多变、脆弱,线上故障频发,如何快速有效地进行应急处置、保障系统的稳定性是每一位 SRE 必须直面的问题。

本次分享将结合美图 SRE 团队的实践经验,深入探讨故障应急的各个环节。并由此展开,给大家呈现一个典型的“故障生命周期”。我将沿着这个脉络对故障的本质和常见原因进行剖析,对可观测性建设、灾备建设、应急预案及演练、故障复盘等日常高频工作场景进行讲解。此外,也将对 AIOps、LLM Ops 等前沿的技术做一些探讨和交流。相信这些内容对于听众,尤其是中小型企业的 SRE 同学,在提高应急响应能力、提升系统稳定性建设水平等方面会有所帮助。

演讲提纲

1. 引子:你是否会“谈故障色变”,遇到故障慌不慌,为个啥?

2. 洞若观火:洞察本质,掌握规律

  • SRE 的核心职责 与 企业发展的关系
  • 构建「大框架」:可靠性工程的「全生命周期」
  • 构建「大框架」:稳定性运营的「全景图」
  • 建立对故障的正确认识
  • 稳定性工作的度量 和 工作目标

3. 未雨绸缪:体系建设,主动出击

  • 体系化建设清单
  • 可观测性建设
  • 高可用建设
  • 应急预案及预案演练
  • SRE 工具箱建设

4. 指挥若定:有章可循,有条不紊

  • 原则和建议
  • 流程机制约定
  • 故障现场指挥
  • 常见故障场景 及 常见手段
  • 非常规模式 及 处置方法
  • 血泪案例分享

5. 复盘改进:吃堑长智,举一反三

  • 工作清单复盘
  • 故障复盘:从“黄金三问”到“深度思考”
  • 如何进行故障的定级、定性、定责?
  • 周期回顾 和 数据洞察

6. 补充总结 & 未来展望

  • 故障管理 之 体系化框架
  • 前沿技术探索及展望

您认为,这样的技术在实践过程中有哪些痛点?

  • “老生常谈”的几个需要平衡的问题及 SRE 所面临的典型困境
    • 稳定性建设的目标、业务高速迭代的效率诉求、公司在稳定建设方面可以投入的资源之间会存在矛盾
    • SRE人手不足、工具建设不到位、忙于救火、疲于应付的恶性循环。破除这些困境,需要找到合适的切入点,方法也因时、因地不尽相同
  • 新技术的应用和落地:AIOps、LLM Ops 等新技术为故障应急带来了新的可能性,现在业界也有很多探索和实践。尤其是随着DeepSeek开源之后,有很多团队也在积极拥抱和尝试,但如何将这些技术真正应用到实践中,在落地过程中还有一些问题尚待探索和解决。
  • 业务系统、环境的复杂性,可能会带来一些“未知的未知”,这些会对故障应急带来非常大的挑战。

演讲亮点

  • 故障管理的流程化和规范化
  • 稳定性运营的持续改进

听众收益

  • 掌握故障应急的系统性方法:从故障的本质出发,系统性地思考和解决故障应急问题,而不是仅仅停留在“头痛医头,脚痛医脚”
  • 提升故障处理的实战能力:了解美图 SRE 团队在故障应急方面的实践,包括可观测性建设、高可用建设、应急预案制定与演练、故障复盘等实操性实践

交通指南

北京石景山万达嘉华酒店

Wanda Jin
地址:北京市石景山区石景山路甲18号院
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手