在当今复杂多变的技术环境中,系统的规模和复杂性不断增加,导致传统的监控和测试方法... 展开 >





党受辉,腾讯 IEG 技术运营部助理总经理,专家工程师。腾讯游戏 SRE 负责人,负责研发工具链、运维自动化、线上可靠性等研运一体基础设施平台蓝鲸智云;信通院 SREelite《SRE 实践白皮书》作者之一。
在当今复杂多变的技术环境中,系统的规模和复杂性不断增加,导致传统的监控和测试方法难以应对。混沌工程与全链路压测是现代分布式系统稳定性保障的两大核心手段,二者既有协同互补性,又存在方法论和目标上的差异,这两项技术已经从海外大厂的局部实践发展为全球性技术范式,其核心价值体现于在事前的压力流量下,通过主动引入故障和不确定性,帮助团队发现系统脆弱点,增强系统弹性和可靠性,将不确定性转化为确定性。在数字化转型深水区,企业可以将混沌工程及全链路压测纳入稳定性战略,通过常态化演练构建“数字免疫防线”,应对愈发复杂的生产环境挑战。最好的系统不是永不崩溃的系统,而是每次崩溃都能变得更强的系统。
本专题讨论的方向:
本专题将邀请 SRE 精英联盟及相关行业的专家们分享混沌工程及全链路压测的成功案例,您将获得有价值的实践经验参考以及提升系统可靠性的前沿方法。
在大型活动技术保障的过程中,容量可谓最重要的保障领域,而全链路压测是当前业界最流行的验证容量能力的解决方案。本次分享我将从蚂蚁大型活动保障架构出发,逐步引出全链路压测体系,通过介绍压测平台架构和压测核心技术方案,尝试回答为什么要做全链路压测和如何做好全链路压测的问题。同时,会通过一个完整的大促压测保障案例,由浅入深阐述蚂蚁全链路压测领域的完整解决方案。最后,对当前火热的 AI 领域压测,提出一些新的思考和展望,以期抛砖引玉,寻求面向未来的压测架构演进方向。
演讲提纲
1. 蚂蚁大型活动保障架构
2. 蚂蚁全链路压测体系
3. 蚂蚁大促全链路压测实战
4. 未来已来!AI 压测
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
在互联网业务高并发、高可用的需求下,混沌工程与全链路压测成为保障系统稳定性的关键手段。混沌工程通过主动注入故障(如硬件、中间件、业务层故障)验证系统韧性,而全链路压测通过模拟真实流量发现性能瓶颈,两者结合可构建稳定、可观测、可自愈的系统。
混沌工程落地需解决业务方接受度、风险控制及与监控/SRE体系的协同问题,其核心技术包括自动化演练与恢复机制。全链路压测则依赖流量染色、影子库等核心技术,需应对突发流量、数据库慢查询等典型问题,并通过常态化压测与AI预测实现智能优化。
二者的互补性体现在:混沌工程验证容错能力,全链路压测验证承载能力。通过结合使用,企业能提前发现并修复潜在问题,为业务连续性提供坚实保障。未来,自动化、智能化与全流程整合将是技术演进的核心方向。
本次演讲我将介绍小米在百万 QPS 场景下,如何通过混沌工程故障注入与全链路压测的协同体系,构建系统韧性防线,探讨自动化演练与 AI 预测驱动的稳定性持续优化路径。
演讲提纲
1. 背景 & 价值
2. 混沌工程:从理论到实践
3. 全链路压测:真实业务场景下的性能验证
4. 混沌工程 + 全链路压测:构建高可用系统
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
随着业务规模的增长,多活容灾架构是解除单一机房风险的必然选择,小红书过去完全长在公有云,到当前开启自建,业务多活架构逐步演进为混合云的容灾架构,一方面我们识别核心业务持续补齐多活架构,另一方面如何确保基于混合云的多活架构在真实机房 & 专线故障时实现逃逸止损是我们不得不面临的挑战,因此我们发现混合云容灾架构建设和治理专项,以容灾演练为牵引,充分挖掘容灾风险并治理,同时建设容灾中控能力,实现容灾故障时核心业务 RTO 控制在 10mins 内。
演讲提纲
1. 小红书混合云演进以及面临的容灾风险与挑战
2. 小红书混合云容灾体系建设
3. 小红书容灾演练实践
4. 未来展望和思考
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
游戏行业高可用面临毫秒级延迟敏感、复杂逻辑低承载及节日流量突增等挑战。本次分享聚焦腾讯游戏在超大 PCU 业务下的全链路保障实践,介绍从设计评审、分层混沌演习到 SRE 领域模型辅助故障定位的完整框架。重点剖析分层混沌工程体系与 AI 驱动的故障定位模型,结合典型业务案例,总结可复用的压测策略与落地经验,为高实时、高并发系统提供工程化参考。
演讲提纲
1. 背景 & 问题:游戏行业高可用的独特挑战
2. 解决思路:从设计到运维的全链路保障框架
3. 技术体系设计与典型案例实践
4. 经验总结:从踩坑到最佳实践
实践痛点
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

