调度系统的通常工作是匹配任务和执行任务的资源,这里的“大规模集群调度... 展开 >



欧阳坚,2006 年毕业于清华大学计算机系,16 年数据中心开发管理经验。现任美团基础技术部技术总监,负责基础软件相关工作。
调度系统的通常工作是匹配任务和执行任务的资源,这里的“大规模集群调度”指:在云计算环境下,把大量任务动态分配到大量云服务器上执行的过程。调度系统给出 What、When、Where的方案,以实现稳定、效率、成本、能耗等多方面的优化目标。大规模集群调度系统管理的资源通常在万台服务器以上,是云计算技术栈的核心系统之一。经过多年的发展,开源产品 Kubernetes 发展成业界的明星项目,基本成为各个公司的标配。 但当前的 K8s 并不能解决企业所有诉求,很多公司根据自身情况做了很多进一步的研发工作。本次我们将重点关注:
随着 Kubernetes 广泛应用,越来越多公司基于 Kubernetes 落地集群调度系统。在集群规模增长同时,社区方案局限性也逐步体现,集群规模受限和只支持按照资源配额调度等问题日渐凸显。其中,资源配额调度问题又是制约集群资源利用率提升的最大痛点。
本次演讲将从真实业务场景出发,讲述如何通过落地动态负载均衡服务,实现动态实时调整容器资源实例,解决资源配额调度问题带来的集群内物理机负载不均衡的问题,并保障业务服务质量,充分实现云计算成本优化。
演讲提纲:
1. 集群调度的核心挑战
2. 集群调度的技术演进建议
3. 动态负载均衡服务落地实践
4. 集群调度未来潜在演进方向
你将获得:
数据密集型服务有其特定的工作特点,在 K8s 下部署调度需要进行特定的适配,尤其是在运行数十万作业,日处理 PB 级别规模的服务场景时,有许多额外新的挑战。本议题从实际案例出发,针对此类规模场景下系统稳定性建设中遇到的典型问题,比如作业资源上限不可控性、算力扩缩容触发机制不够灵活等,探讨这些问题的根源,以及落地的处理实践。
演讲提纲:
1. 数据密集型服务的架构特点
2. 云原生下数据密集型服务的架构适配
3. 该架构下稳定性常见挑战
4. 对应问题处理方案与实践
5. 未来展望
你将获得:



微信咨询

电话咨询
微信联系我们

