专题演讲嘉宾:熊豹

知乎SRE 高级工程师

熊豹(faceair),知乎 SRE 高级工程师,目前负责推进可观测系统建设。2016 年加入知乎,先后参与过移动 API、知乎 Live、付费咨询等业务项目,后主导过多厂商融合推送、分布式 MQTT 集群、云原生 API 网关等系统的设计和实现,具备较高的业务敏感度和丰富的平台设施架构经验。

by 熊豹

知乎
SRE 高级工程师

Graphite 是知乎当前最主要的指标系统,被广泛应用在几乎所有的监控场景:

  • CDN、动态加速分地区、运营商监控,长短连接网关状态码、出入流量监控
  • 数千微服务运行监控,支撑故障定位、依赖分析、性能分析等场景
  • 大量业务场景 (商业广告投放、前端资源加载、推送全链路等) 实时监控
  • 全量基础资源实例 (Redis、MySQL、Kafka、Hbase 等) 运行监控
  • 多机房万级物理机多维度资源利用率监控

随着知乎内基础设施云原生化推进,随着业务规模扩大和复杂度逐渐上升,Graphite 指标系统的性能、可维护性等方面都岌岌可危,我们站在一个亟需变革的边缘!本次演讲将分享该系统的背景和设计思路。

内容大纲

1. 现有开源方案有什么不足?

在 Whisper 存储引擎的泥潭中翻滚挣扎,磁盘不足、内存暴涨、CPU 飙升,我们受够了!

传统监控方案的时序数据库应该如何搭上云原生发展的快车道?这个思路 Open-Falcon 也能用!

2. 我们的方案:Graphite On Prometheus,快乐翻倍!

打破思想的桎梏!加速,加速!Graphite 与 Prometheus 从指标设计、查询语法到存储引擎走向全面融合!

提升 100 倍查询性能,降低 10000 倍磁盘 IOPS,我们把单机存储指标数从业界平均 100w 提升到 200,000w !

3. 着眼未来!Graphite 已死,Statsd 永生!

云原生领域的监控系统关注了什么?业务使用的监控系统还应该如何考量?

我们应该如何权衡业界最佳实践,设计出一套更完备的大统一指标架构?

听众收益

  1. 打破你对指标监控系统的固有认知,快速理解不同方案间的取舍和差异
  2. 获得开箱即用的传统监控的指标存储优化方案,快速提升各方面的性能
  3. 分享我们对指标监控领域大图景的认知

适合人群

SRE 工程师,运维工程师,DevOps 工程师,研发项目经理

交通指南

深圳机场凯悦酒店

Hyatt Regency Shenzhen Airport
地址:广东省深圳市宝安区空港八道12号
  • 微信咨询

  • 电话咨询

    联系电话:+86 17310043226

微信联系我们

小姐姐 Ring