百度云原生可观测方向技术负责人,2012 年加入百度,先后负责构建运维数据仓库,网络监控平台、智能监控平台,故障自愈平台、云原生可观测平台的架构设计与研发工作。在监控与可观测领域有丰富经验。
Prometheus 作为云原生时代指标监控的事实标准已经深入人心,其优秀的指标数据模型、强大的查询分析能力以及丰富的周边生态支持,让监控变的更加便捷易用。
但在业界常见的实践案例中,更多是介绍如何做基础的 Kubernetes、主机、中间件监控。而对于大型互联网、金融等行业,则会更加关注交易/请求量、成功率、响应时间等业务层指标监控,同时基于细分业务维度进行细粒度的故障发现与定位。这就对监控系统提出了大规模高性能、计算报警低延迟、数据高可靠、平台高可用多方面要求,对常见的 Prometheus 解决方案带来巨大挑战。
本次演讲将介绍百度云原生团队是如何针对互联网、金融等行业大规模业务监控的需求,构建基于 Prometheus 的高性能、高可用解决方案。
演讲提纲:
1. 大规模业务监控在 Prometheus 架构中遇到的挑战
2. 针对业务监控场景的高性能、高可用的 Prometheus 监控方案实践
3. 总结与展望
你将获得:



微信咨询

电话咨询
微信联系我们

