从卡顿到稳定:腾讯游戏海量支撑与容灾实践

所属专题:混沌工程与全链路压测

嘉宾 : 张廷进 | 腾讯IEG 技术运营部高级工程师

会议室 : 多功能厅 2

讲师介绍

专题演讲嘉宾:张廷进

腾讯IEG 技术运营部高级工程师

2010 年加入腾讯,主导构建腾讯自研游戏 SRE 体系,负责《和平精英》等数十款头部游戏的技术运营,参与亿级 DAU 业务的高可用架构设计和支撑。作为腾讯游戏 TDR(Technical Design Review)评审委员会核心专家,主导业务上线前的架构容灾风险评估与优化,累计评审项目超 30+,通过混沌工程和全链路压测的实践落地,推动腾讯游戏可用性持续提升。

议题介绍

演讲:从卡顿到稳定:腾讯游戏海量支撑与容灾实践

游戏行业高可用面临毫秒级延迟敏感、复杂逻辑低承载及节日流量突增等挑战。本次分享聚焦腾讯游戏在超大 PCU 业务下的全链路保障实践,介绍从设计评审、分层混沌演习到 SRE 领域模型辅助故障定位的完整框架。重点剖析分层混沌工程体系与 AI 驱动的故障定位模型,结合典型业务案例,总结可复用的压测策略与落地经验,为高实时、高并发系统提供工程化参考。

演讲提纲

1. 背景 & 问题:游戏行业高可用的独特挑战

  • 高实时性:毫秒级延迟敏感,生产环境压测难实施;服务器性能裕量小,CPU > 60% 即出现卡顿投诉
  • 低承载能力:复杂逻辑导致单机承载远低于互联网平均水平;大版本更新可能需要一次性扩容数十万核心
  • 瞬时流量冲击:周年庆、春节等活动 1 分钟内连接数可暴增 N 倍;新玩法上线导致同等在线下,资源需求激增

2. 解决思路:从设计到运维的全链路保障框架

  • 容灾能力建设
    • 开发设计阶段:TDR 评审,提前规避单点与性能瓶颈
    • 测试阶段:删档测试期的分层混沌演习,暴露弱点
    • 上线阶段:SRE 领域模型辅助故障快速定位
  • 容量规划与验证策略
    • 全链路压测:模拟从登录到战斗的 90% 核心路径
    • 局部生产压测:动态注入流量验证单模块承载

3. 技术体系设计与典型案例实践

  • 分层混沌工程体系设计
    • 接入层:DNS 解析异常、网络抖动、机房不可用
    • 逻辑层:单点模块故障、过载保护、负载均衡策略验证、数据保护机制验证
    • 存储层:DB Proxy 异常、主从切换、IP 变更对业务的影响
  • SRE 领域模型训练与应用
    • 数据来源:历史故障、混沌演习日志、运维知识库
    • 技术路径:
      • 预训练:大规模运维经验语料
      • 精调:领域知识 + 领域技能双向微调
      • 强化学习:混沌场景驱动外网异常应对能力提升
    • 效果:故障定位时间显著缩短,减少人为排查成本
  • 典型实践案例
    • 超大 PCU 业务上线保障  
    • 典型游戏业务服务器架构设计
    • 关键模块的高可用风险及优化思路
    • 腾讯游戏混沌工程实践

4. 经验总结:从踩坑到最佳实践

  • 不同业务体量的压测策略选择
  • 混沌工程落地的常见陷阱与改进路径

实践痛点  

  • 如何通过 SRE 左移在业务开发前期,建立架构评审的关键要求和标准,推动落地执行,提升架构设计的健壮性?
  • 外网运行中为数千万用户提供服务的生产环境,注入压测流量在大部分场景下通常不具备可行性,如何通过局部压测的方式评估业务完整承载能力?
  • 日常稳定增长的业务场景和海量突发场景,在支撑模式和关注点上有什么区别?

演讲亮点

  • 游戏行业高可用架构设计的关键方法
  • 游戏行业容灾能力验证的方法和混沌工程的应用
  • 游戏行业压测的方法及重点关注的指标
  • 游戏行业海量支撑实践及关键节点的重保流程

听众收益  

  • 了解游戏行业的高可用架构设计的经验,常见薄弱环节及解决方法,可用于业务自身开发时提升健壮性的参考
  • 了解混沌工程在游戏行业的落地经验
  • 了解 SRE 专属大模型在混沌、压测、故障定位等领域的落地经验
  • 理解游戏业务海量容量规划的经验
  • 了解业务架构设计中的,可用于业务自身开发时提升健壮性的参考

交通指南

上海浦东滨江喜来登酒店

SHERATON SHANGHAI PUDONG RIVERSIDE
地址:上海浦东大道2288号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手