熊豹(faceair),知乎 SRE 高级工程师,目前负责推进可观测系统建设。2016 年加入知乎,先后参与过移动 API、知乎 Live、付费咨询等业务项目,后主导过多厂商融合推送、分布式 MQTT 集群、云原生 API 网关等系统的设计和实现,具备较高的业务敏感度和丰富的平台设施架构经验。

熊豹(faceair),知乎 SRE 高级工程师,目前负责推进可观测系统建设。2016 年加入知乎,先后参与过移动 API、知乎 Live、付费咨询等业务项目,后主导过多厂商融合推送、分布式 MQTT 集群、云原生 API 网关等系统的设计和实现,具备较高的业务敏感度和丰富的平台设施架构经验。
Graphite 是知乎当前最主要的指标系统,被广泛应用在几乎所有的监控场景:
随着知乎内基础设施云原生化推进,随着业务规模扩大和复杂度逐渐上升,Graphite 指标系统的性能、可维护性等方面都岌岌可危,我们站在一个亟需变革的边缘!本次演讲将分享该系统的背景和设计思路。
内容大纲
1. 现有开源方案有什么不足?
在 Whisper 存储引擎的泥潭中翻滚挣扎,磁盘不足、内存暴涨、CPU 飙升,我们受够了!
传统监控方案的时序数据库应该如何搭上云原生发展的快车道?这个思路 Open-Falcon 也能用!
2. 我们的方案:Graphite On Prometheus,快乐翻倍!
打破思想的桎梏!加速,加速!Graphite 与 Prometheus 从指标设计、查询语法到存储引擎走向全面融合!
提升 100 倍查询性能,降低 10000 倍磁盘 IOPS,我们把单机存储指标数从业界平均 100w 提升到 200,000w !
3. 着眼未来!Graphite 已死,Statsd 永生!
云原生领域的监控系统关注了什么?业务使用的监控系统还应该如何考量?
我们应该如何权衡业界最佳实践,设计出一套更完备的大统一指标架构?
听众收益
适合人群
SRE 工程师,运维工程师,DevOps 工程师,研发项目经理



微信咨询

电话咨询
微信联系我们

