混沌工程与全链路压测

会议室:多功能厅 2
出品人:党受辉

在当今复杂多变的技术环境中,系统的规模和复杂性不断增加,导致传统的监控和测试方法... 展开 >

专题出品人:党受辉

腾讯 IEG技术运营部助理总经理,专家工程师

党受辉,腾讯 IEG 技术运营部助理总经理,专家工程师。腾讯游戏 SRE 负责人,负责研发工具链、运维自动化、线上可靠性等研运一体基础设施平台蓝鲸智云;信通院 SREelite《SRE 实践白皮书》作者之一。

地点:多功能厅 2

专题:混沌工程与全链路压测

在当今复杂多变的技术环境中,系统的规模和复杂性不断增加,导致传统的监控和测试方法难以应对。混沌工程与全链路压测是现代分布式系统稳定性保障的两大核心手段,二者既有协同互补性,又存在方法论和目标上的差异,这两项技术已经从海外大厂的局部实践发展为全球性技术范式,其核心价值体现于在事前的压力流量下,通过主动引入故障和不确定性,帮助团队发现系统脆弱点,增强系统弹性和可靠性,将不确定性转化为确定性。在数字化转型深水区,企业可以将混沌工程及全链路压测纳入稳定性战略,通过常态化演练构建“数字免疫防线”,应对愈发复杂的生产环境挑战。最好的系统不是永不崩溃的系统,而是每次崩溃都能变得更强的系统。

本专题讨论的方向:

  • 双场景的韧性协同,全链路压测确保系统承压能力,混沌工程验证故障场景下的自动恢复机制,从“已知性能极限”到“未知故障影响”
  • 验证维度互补,将“系统吞吐量、延迟等性能边界”和“熔断、降级、容错等韧性机制”相融合
  • 双实践的闭环协同,构建全周期验证体系,压测中的混沌增强,混沌实验的压测基线,及​统一的可观测性支撑
  • 行业的融合趋势,例如在故障演练平台融合流量压测与故障注入的联动编排,实现“性能-韧性”联合验证;混沌工程与全链路压测纳入同一成熟度评估体系,形成“性能测试-故障演练-优化闭环”的完整生命周期

本专题将邀请 SRE 精英联盟及相关行业的专家们分享混沌工程及全链路压测的成功案例,您将获得有价值的实践经验参考以及提升系统可靠性的前沿方法。

by 刘凯宁

蚂蚁集团
SRE 技术专家

在大型活动技术保障的过程中,容量可谓最重要的保障领域,而全链路压测是当前业界最流行的验证容量能力的解决方案。本次分享我将从蚂蚁大型活动保障架构出发,逐步引出全链路压测体系,通过介绍压测平台架构和压测核心技术方案,尝试回答为什么要做全链路压测和如何做好全链路压测的问题。同时,会通过一个完整的大促压测保障案例,由浅入深阐述蚂蚁全链路压测领域的完整解决方案。最后,对当前火热的 AI 领域压测,提出一些新的思考和展望,以期抛砖引玉,寻求面向未来的压测架构演进方向。

演讲提纲

1. 蚂蚁大型活动保障架构

  • 蚂蚁大促活动分级
  • 蚂蚁大促活动 SOP
  • 蚂蚁大促整体架构
  • 蚂蚁大促容量架构

2. 蚂蚁全链路压测体系

  • 为什么要做全链路压测?
  • 蚂蚁全链路压测平台架构介绍
  • 蚂蚁全链路压测核心技术介绍
    • 压测全链路染色达标
    • 压测前置风险校验
    • 压测隔离
    • 压测秒级熔断
    • 压测溯源定位
    • 压测窗口及白名单
    • 业务特色压测
    • 压测用户资产
    • 压测营销配置
    • 算法压测

3. 蚂蚁大促全链路压测实战

  • 容量评估与资源交付
  • 压测模型整理
  • 压测脚本编写与调试
  • 压测配置与资产准备
  • 压测计划制定
  • 压测执行及值班
  • 压测报告产出及总结

4. 未来已来!AI 压测

  • AI 链路的特点
  • AI 场景的压测关注点
  • AI 场景的压测实践
  • AI 压测展望

您认为,这样的技术在实践过程中有哪些痛点?

  • 公司技术标准的统一、中间件及存储产品的适配情况、业务对压测的认知及配合程度,都将成为能否真正实现全链路压测的痛点,我们不否认全链路压测的改造成本。

演讲亮点

  • 围绕技术风险构建压测能力
  • 基于活动保障的要求沉淀全链路压测 SOP

听众收益

  • 了解大型活动保障架构及 SOP
  • 全面了解全链路压测完整的过程

by 张平

小米
高级工程师

在互联网业务高并发、高可用的需求下,混沌工程与全链路压测成为保障系统稳定性的关键手段。混沌工程通过主动注入故障(如硬件、中间件、业务层故障)验证系统韧性,而全链路压测通过模拟真实流量发现性能瓶颈,两者结合可构建稳定、可观测、可自愈的系统。

混沌工程落地需解决业务方接受度、风险控制及与监控/SRE体系的协同问题,其核心技术包括自动化演练与恢复机制。全链路压测则依赖流量染色、影子库等核心技术,需应对突发流量、数据库慢查询等典型问题,并通过常态化压测与AI预测实现智能优化。

二者的互补性体现在:混沌工程验证容错能力,全链路压测验证承载能力。通过结合使用,企业能提前发现并修复潜在问题,为业务连续性提供坚实保障。未来,自动化、智能化与全流程整合将是技术演进的核心方向。

本次演讲我将介绍小米在百万 QPS 场景下,如何通过混沌工程故障注入与全链路压测的协同体系,构建系统韧性防线,探讨自动化演练与 AI 预测驱动的稳定性持续优化路径。

演讲提纲

1. 背景 & 价值

  • 行业趋势与挑战
    • 互联网业务高并发、高可用的需求
    • 故障不可避免,如何提前发现并优化
  • 混沌工程与全链路压测的核心价值
    • 混沌工程:主动注入故障,验证系统韧性
    • 全链路压测:模拟真实流量,发现性能瓶颈
    • 两者结合:构建稳定、可观测、可自愈的系统

2. 混沌工程:从理论到实践

  • 混沌工程平台建设
    • 故障注入类型(基础硬件故障、容器故障、中间件故障、业务应用故障等)
    • 自动化演练与监控恢复机制
    • 混沌工程核心技术架构与技术挑战
  • 混沌工程的落地挑战
    • 如何说服业务方接受故障演练?
    • 如何控制演练风险?
    • 如何与监控、告警、SRE 体系结合?

3. 全链路压测:真实业务场景下的性能验证

  • 全链路压测的核心技术
    • 全链路压测核心技术架构与技术挑战
    • 流量染色:区分压测流量与真实流量
    • 影子库/影子表:避免污染生产数据
    • 压测场景建模(突发流量、热点请求、异常情况)
  • 大促保障实战经验
    • 如何设计压测方案(逐步加压 vs. 极限施压)
    • 典型性能问题与优化手段(DB慢查询、缓存击穿、线程池耗尽)
  • 压测的常态化与自动化
    • 如何让压测成为研发流程的一部分?
    • 智能压测:结合AI预测流量高峰

4. 混沌工程 + 全链路压测:构建高可用系统

  • 两者的互补关系
  • 混沌工程验证系统容错能力
  • 全链路压测验证系统承载能力
  • 结合使用:提前发现并修复潜在问题

您认为,这样的技术在实践过程中有哪些痛点?

  • 故障注入和压测需要的数据准备
  • 混沌及压测的流程编排

演讲亮点

  • 流程编排是独有的,符合真实业务的场景
  • 应用落地了最新的开发技术,比如 Java 21 等

听众收益

  • 小米公司是如何在开展多个高度复杂业务场景下的稳定性保障,哪些可以借鉴
  • 探讨小米公司面向未来,应对更大流量更复杂流程场景的下的技术保障规划
  • 了解前沿开发技术在真实高并发场景下的落地情况

by 陈鹏

小红书
高可用架构师

随着业务规模的增长,多活容灾架构是解除单一机房风险的必然选择,小红书过去完全长在公有云,到当前开启自建,业务多活架构逐步演进为混合云的容灾架构,一方面我们识别核心业务持续补齐多活架构,另一方面如何确保基于混合云的多活架构在真实机房 & 专线故障时实现逃逸止损是我们不得不面临的挑战,因此我们发现混合云容灾架构建设和治理专项,以容灾演练为牵引,充分挖掘容灾风险并治理,同时建设容灾中控能力,实现容灾故障时核心业务 RTO 控制在 10mins 内。

演讲提纲

1. 小红书混合云演进以及面临的容灾风险与挑战

  • 小红书混合云演进历程
  • 容灾风险识别和面临的挑战
  • 专线各机房间的专线故障以及流量管理
  • 架构复杂度陡增:故障链路更长,存在跨云跨地域依赖
  • 容灾演练覆盖度不足:混合云演练需要更强的组织和演练效率覆盖各类组合故障
  • 如何平衡业务效果和容灾要求、故障发生时各业务逃逸止损的协同效率等挑战

2. 小红书混合云容灾体系建设

  • 容灾建设思路
  • 混合云容灾规范:明确混合云环境下业务系统容灾能力建设标准
  • 管控面容灾建设:确保容灾指令在任意单机房故障场景下正确下发
  • 核心机房治理
  • 业务梳理和真实混沌演练进行风险摸底
  • 存储风险治理
  • 离线数据链路治理
  • 容灾中控建设:实现容灾全局业务可观测和止损预案全局可控

3. 小红书容灾演练实践

  • 演练体系搭建:容灾演练规划,包括业务影响和风险评估、组织阵型、混沌方案、剧本、容灾预案设计和回滚机制等
  • 演练典型案例分享

4. 未来展望和思考

  • 技术升级:探讨接下来混合云容灾的进阶技术路径,引入AI辅助故障预测和自动决策、生效更快更准的逃逸能力建设和打磨、常态化多活容灾架构保鲜等
  • 业务和容灾深度融合:如何让容灾能力更贴合业务发展,比如新业务上线容灾能力建设标准化流程、更复杂的国际化业务容灾思考

您认为,这样的技术在实践过程中有哪些痛点?

  • 每家公司都有不一样的infra演进路径和基建选型,如何针对小红书特有的混合云 Infra 和基建能力并结合容灾目标设计合理的容灾架构
  • 容灾演练如何控制好爆炸半径和业务损失,以及通过建设哪些平台能力提升容灾演练的准确性(演练真实性)和效率(演练经济性)

演讲亮点

  • 基于小红书混合云特色的容灾体系建设和容灾演练最佳实践

听众收益

  • 了解小红书混合云演进和业务容灾架构建设进程
  • 了解小红书的容灾体系建设的思考路径和最佳实践
  • 了解小红书容灾演练的实践和踩坑经验,学习如何做好容灾演练计划、方案设计以及组织实施

by 张廷进

腾讯
IEG 技术运营部高级工程师

游戏行业高可用面临毫秒级延迟敏感、复杂逻辑低承载及节日流量突增等挑战。本次分享聚焦腾讯游戏在超大 PCU 业务下的全链路保障实践,介绍从设计评审、分层混沌演习到 SRE 领域模型辅助故障定位的完整框架。重点剖析分层混沌工程体系与 AI 驱动的故障定位模型,结合典型业务案例,总结可复用的压测策略与落地经验,为高实时、高并发系统提供工程化参考。

演讲提纲

1. 背景 & 问题:游戏行业高可用的独特挑战

  • 高实时性:毫秒级延迟敏感,生产环境压测难实施;服务器性能裕量小,CPU > 60% 即出现卡顿投诉
  • 低承载能力:复杂逻辑导致单机承载远低于互联网平均水平;大版本更新可能需要一次性扩容数十万核心
  • 瞬时流量冲击:周年庆、春节等活动 1 分钟内连接数可暴增 N 倍;新玩法上线导致同等在线下,资源需求激增

2. 解决思路:从设计到运维的全链路保障框架

  • 容灾能力建设
    • 开发设计阶段:TDR 评审,提前规避单点与性能瓶颈
    • 测试阶段:删档测试期的分层混沌演习,暴露弱点
    • 上线阶段:SRE 领域模型辅助故障快速定位
  • 容量规划与验证策略
    • 全链路压测:模拟从登录到战斗的 90% 核心路径
    • 局部生产压测:动态注入流量验证单模块承载

3. 技术体系设计与典型案例实践

  • 分层混沌工程体系设计
    • 接入层:DNS 解析异常、网络抖动、机房不可用
    • 逻辑层:单点模块故障、过载保护、负载均衡策略验证、数据保护机制验证
    • 存储层:DB Proxy 异常、主从切换、IP 变更对业务的影响
  • SRE 领域模型训练与应用
    • 数据来源:历史故障、混沌演习日志、运维知识库
    • 技术路径:
      • 预训练:大规模运维经验语料
      • 精调:领域知识 + 领域技能双向微调
      • 强化学习:混沌场景驱动外网异常应对能力提升
    • 效果:故障定位时间显著缩短,减少人为排查成本
  • 典型实践案例
    • 超大 PCU 业务上线保障  
    • 典型游戏业务服务器架构设计
    • 关键模块的高可用风险及优化思路
    • 腾讯游戏混沌工程实践

4. 经验总结:从踩坑到最佳实践

  • 不同业务体量的压测策略选择
  • 混沌工程落地的常见陷阱与改进路径

实践痛点  

  • 如何通过 SRE 左移在业务开发前期,建立架构评审的关键要求和标准,推动落地执行,提升架构设计的健壮性?
  • 外网运行中为数千万用户提供服务的生产环境,注入压测流量在大部分场景下通常不具备可行性,如何通过局部压测的方式评估业务完整承载能力?
  • 日常稳定增长的业务场景和海量突发场景,在支撑模式和关注点上有什么区别?

演讲亮点

  • 游戏行业高可用架构设计的关键方法
  • 游戏行业容灾能力验证的方法和混沌工程的应用
  • 游戏行业压测的方法及重点关注的指标
  • 游戏行业海量支撑实践及关键节点的重保流程

听众收益  

  • 了解游戏行业的高可用架构设计的经验,常见薄弱环节及解决方法,可用于业务自身开发时提升健壮性的参考
  • 了解混沌工程在游戏行业的落地经验
  • 了解 SRE 专属大模型在混沌、压测、故障定位等领域的落地经验
  • 理解游戏业务海量容量规划的经验
  • 了解业务架构设计中的,可用于业务自身开发时提升健壮性的参考

交通指南

上海浦东滨江喜来登酒店

SHERATON SHANGHAI PUDONG RIVERSIDE
地址:上海浦东大道2288号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手