以往,业界对于宏观层面的架构稳定性方面有诸多探讨,但这次我们希望也能看到一些微观... 展开 >





花名毕啸,菜鸟网络资深技术专家,菜鸟架构委员会负责人,平台和数据技术部负责人。专注于复杂架构设计、高可用架构、云原生体系、业务架构设计和建模、数据驱动的应用架构,统筹菜鸟技术相关的安全生产、技术降本、技术平台、数据中台等核心能力构建,打造产业互联网新技术架构体系。三年阿里全球化技术架构体系建设,最近几年聚焦菜鸟产业互联网新技术架构体系的构建,涉及高鲁棒、高效率以及强智能等新一代架构的升级。
以往,业界对于宏观层面的架构稳定性方面有诸多探讨,但这次我们希望也能看到一些微观层面的内容,比如超时/pct99 延迟抖动/上下游处理耗时 Gap 大/服务起不来/coredump/无日志反复重启/内存占用大/CPU 高等等问题,回想一下,过去一年,你们接到的 Oncall 是不是一大半都是这些问题?在异地多活等话题之外,从线上问题排查到性能工具,本专题还将邀请一线专家分享一些实际的线上问题应对经验。
现有的高可用理念与产品,如系统可用率、MTBF/MTTR、可观测等,更多是在高并发的消费互联网场景。菜鸟作为一家物流产业互联网公司,物流的长链路、多节点、复杂业务需求场景和消费互联网有着天然差异,对高可用的诉求也迥然不同。「单笔高可用」是菜鸟在产业互联网的新架构下,在高可用方向上的一个探索与实践。本文将从单笔高可用的定义、做单笔高可用的原因、落地单笔高可用的途径三个层面分享菜鸟的经验。
演讲提纲:
1. 高可用概念定义
2. 产业互联网的单笔高可用场景
3. 如何做单笔高可用与鲁棒性架构
4. 单笔高可用落地实践
你将获得:
随着公有云市场的高速增长和云原生技术的发展,企业用户逐步向云原生架构迁移,系统内的微服务进一步朝着分布式的架构演进,微服务数量呈爆炸式增长,各服务间相互调用关系也变得更为繁杂,这对软件的可靠性提出了更高的要求,而传统的质量工程和软件测试很难检测出生产环境中的意外故障和性能问题。为了应对愈发复杂的实际生产问题,混沌工程应运而生,它可以帮助用户提前检测出生产环境中可能潜在的故障和性能问题。本次演讲介绍字节混沌工程在云原生场景下的落地实践,其中重点介绍多集群,多场景,可观测的混沌平台的系统设计经验。同时也会分享在不同业务场景下的应用案例和分析。
演讲提纲:
1. 混沌工程背景介绍
2. 工程设计与实践
3. 成功案例分析
4. 总结展望
你将获得:
随着云计算技术的成熟,大量用户将服务部署到了公有云上。做为消息队列领域主要产品的 Apache Kafka ,因其架构设计本身的缺陷,导致其在长期存储、集群快速扩缩容等方面一直存在不足。尤其在大规模的集群运营过程中,问题尤为明显。另外,随着降本增效的诉求越来越强烈,为了降低成本,弹性的 Kakfa 架构慢慢成为了刚需。即用户迫切需要根据实际使用容量来弹性按量的使用 Kafka。此时,底层就需要无需感知底层资源的 Serverless 形态的 Kafka,以应对突发流量、波峰波谷等带来的稳定性和成本问题。因此需要从架构升级、混沌演练、运营体系等方面解决稳定性和成本的诉求。
本次分享主要通过弹性的计算存储架构、混沌工程演练、自动化调度运营体系三个维度来讲一下在降本增效的背景下如何保证大规模 Kafka 集群的稳定性。
演讲提纲:
1. 降本增效背景下大规模 Kafka 集群面临的稳定性挑战
2. 如何通过弹性的计算存储架构来提高集群的稳定性
3. 混沌工程在云上大规模 Kafka 集群 的落地实践
4. 云上消息队列在降本、稳定性、架构升级之间权衡的一些思考
你将获得:
华为云交易系统的业务流程非常复杂,传统的数据稽核、日志监控、接口监控等监控体系,无法将一个完整的流程串起来,但是一个完整的流程会话非常关键,它对于我们快速发现问题、定界问题和确认故障恢复影响范围非常重要。
我们基于流程引擎和有向图思想,支持用户自行编排静态业务流程图,并在流程图元上挂载轨迹数据源,可实时跟踪到完整的业务流程会话,并支持按照设计好的稽核规则对会话业务数据做稽核,判断异常并发送告警,能很好的支撑问题的快速发现定界和故障影响范围确认。当前,数据流平台接入的服务数量200+,数据流量达2000万/小时。应用数据流平台后,华为云交易系统的平均定界耗时从 30 分钟可降低到 5 分钟内。本次分享将对以上经验做出分享。
演讲提纲:
1. 华为云交易系统架构和监控体系
2. 交易系统监控的问题和技术挑战
3. 数据流平台介绍
4. 总结和展望
你将获得:



微信咨询

电话咨询
领取往期热门演讲视频

