互联网时代对系统的可靠性提出更高的要求。关键系统往往要求4个9的可用性,也就是每... 展开 >





刘道儒为微博基础架构部负责人,曾供职于搜狗等公司。负责微博云平台、运维、DBA 等基础平台及关系流、推荐引擎等后端系统的研发工作,同时负责微博热点应对及全站稳定性保障工作。擅长云原生架构及大规模分布式系统的构架和高可用保障,在云原生、混合云、大规模数据的存储、处理、访问、高可用保障等方面有丰富的实践经验。作为项目负责人,曾主导过微博多机房部署、微博A/B测试平台、微博混合云、客户端 Feed 性能优化等项目,并主要参与了微博平台化改造、平台稳定性改造等项目,目前主要关注云原生、混合云、大数据架构、AIOps 等技术方向。
互联网时代对系统的可靠性提出更高的要求。关键系统往往要求4个9的可用性,也就是每年的不可用时间不能超过53分钟。与此同时,各种开源框架、工具以及工程方法的使用,在提升效率的同时,也带来系统架构复杂,系统失败容易迅速蔓延,副作用被放大。有时一个错误的数据操作或者一行简单的代码缺陷就能使核心系统瘫痪且迟迟无法恢复。为了应对这个挑战,不同的公司结合本身的技术能力和业务特点,形成了多样的可靠性最佳实践。
随着硬件种类的增加和功能多样性、操作系统的复杂度也在提升。操作系统级别的可靠性建设难度也随着提高。从操作系统内核、虚拟化以及工具开发等方面着手,致力于解决内存硬件故障导致的服务不可用、操作系统崩溃以及业务的延迟抖动等问题,业务的可靠性和稳定性得到了较大的改善。
演讲提纲:
你将获得:
可靠性保障是一个复杂的系统工程,特别对于可靠性已经出现问题的线上服务,在业务迭代、成本约束、人力投入等方面的约束下 ,提升其可用性需就不再是单纯的技术问题了。
微博推荐引擎作为各类推荐业务在线服务的枢纽环节支持着微博热门流,小视频后推荐等业务,在快速的迭代过程中,其可靠性问题逐渐暴露出来。同时随着业务需求的变化,其在物料规模,已读过滤等方面的限制逐渐成为了限制迭代的瓶颈点。频发的抖动与宕机,快速膨胀到几十万行的代码,极大的消耗了开发同学的精力。在多重的压力下,推荐引擎已经滑向了失控的边缘。
本次分享将介绍将介绍微博推荐引擎在数月的时间里从不可控回到可控,可用性由不足2个9提升至3个9以上,同时提升业务支持能力的经验。
演讲提纲:
你将获得:
阿里云弹性计算产品的计算节点作为百万级客户基础设施稳定性保障。结合 DevOps 方向社区经验,以及阿里巴巴集团已有基础服务基础上,阿里云弹性计算构建了一套智能诊断平台,实现了运维规模、自动化运维能力、客户运维能力、故障快速恢复几方面能力。
本次分享会跟大家介绍我们是如何设计和建设这套体系,以及如何解决我们在过程中遇到的技术难点;最后还会重点介绍阿里巴巴集团以及其他头部客户结合我们的智能诊断运维体系,如何在自身业务上形成最佳实践,希望借此机会与大家共同学习进步。
演讲提纲:
你将获得:
首先介绍到家开放平台版本演进及全局系统架构,然后重点介绍开放平台接口服务发布系统、开放平台商家自助对接解决方案、基于Web的商家实时消息自助订阅方案、开放平台接口网关统一链路服务化流程、轻量级的商家系统对接快速联调测试解决方案、快速定位商家系统对接业务接口的全链路日志解决方案、开放平台一体化服务运营、统计监控预警系统。最后,分享商家系统对接过程中各类问题的解决方案。
演讲提纲:
听众受益:
了解行业内开放平台常规架构、到家开放平台0到1构建过程、如何适配公司业务发展迭代开放平台版本、到家开放平台核心系统架构实践解决方案、商家开发者自助系统对接的轻量级解决方案、以及如何面对商家系统对接过程中遇到的各类问题以及实践解决方案。



微信咨询

电话咨询
微信联系我们

