大规模集群调度

会议室:大宴会厅 1
出品人:欧阳坚

调度系统的通常工作是匹配任务和执行任务的资源,这里的“大规模集群调度... 展开 >

专题出品人:欧阳坚

美团技术总监

欧阳坚,2006 年毕业于清华大学计算机系,16 年数据中心开发管理经验。现任美团基础技术部技术总监,负责基础软件相关工作。

地点:大宴会厅 1

专题:大规模集群调度

调度系统的通常工作是匹配任务和执行任务的资源,这里的“大规模集群调度”指:在云计算环境下,把大量任务动态分配到大量云服务器上执行的过程。调度系统给出 What、When、Where的方案,以实现稳定、效率、成本、能耗等多方面的优化目标。大规模集群调度系统管理的资源通常在万台服务器以上,是云计算技术栈的核心系统之一。经过多年的发展,开源产品 Kubernetes 发展成业界的明星项目,基本成为各个公司的标配。 但当前的 K8s 并不能解决企业所有诉求,很多公司根据自身情况做了很多进一步的研发工作。本次我们将重点关注:

  • 集群如何支撑大规模在线系统
  • 集群如何支持大规模机器学习
  • 如何做好大规模集群的稳定性保障和成本优化
  • 云原生调度系统

by 谭霖

美团
集群调度系统负责人

随着 Kubernetes 广泛应用,越来越多公司基于 Kubernetes 落地集群调度系统。在集群规模增长同时,社区方案局限性也逐步体现,集群规模受限和只支持按照资源配额调度等问题日渐凸显。其中,资源配额调度问题又是制约集群资源利用率提升的最大痛点。

本次演讲将从真实业务场景出发,讲述如何通过落地动态负载均衡服务,实现动态实时调整容器资源实例,解决资源配额调度问题带来的集群内物理机负载不均衡的问题,并保障业务服务质量,充分实现云计算成本优化。

演讲提纲:

1. 集群调度的核心挑战

2. 集群调度的技术演进建议

  • 从静态模型到动态模型的优化

3. 动态负载均衡服务落地实践

4. 集群调度未来潜在演进方向

你将获得:

  • 开拓一些新思路,了解如何用新方法解决传统的资源调度问题
  • 了解目前集群调度领域相关的挑战
  • 了解在与云原生场景结合的情况下,集群演进的更多可能性

by 袁庆军

阿里云
技术专家

数据密集型服务有其特定的工作特点,在 K8s 下部署调度需要进行特定的适配,尤其是在运行数十万作业,日处理 PB 级别规模的服务场景时,有许多额外新的挑战。本议题从实际案例出发,针对此类规模场景下系统稳定性建设中遇到的典型问题,比如作业资源上限不可控性、算力扩缩容触发机制不够灵活等,探讨这些问题的根源,以及落地的处理实践。

演讲提纲:

1. 数据密集型服务的架构特点
2. 云原生下数据密集型服务的架构适配
3. 该架构下稳定性常见挑战

  • 作业资源上限不可控性
  • 算力扩缩容触发机制不够灵活
  • 热升级回滚限制
  • 云上多集群运维复杂度
  • 组件兼容性问题
  • 其他问题

4. 对应问题处理方案与实践

  • 动态调节与反压机制
  • 通过自定义扩缩容指标扩展
  • 多集群调度迁移
  • 其他方案策略

5. 未来展望

你将获得:

  • 对数据密集型服务的架构特点,及其在 K8s 下部署适配有完整认识
  • 深入理解云原生下数据密集型服务(如 ETL 系统)稳定性建设的挑战,及其对应处理方案

交通指南

北京·四季酒店

Beijing International Convention Center
地址:北京市朝阳区亮马桥路48号
  • 微信咨询

  • 电话咨询

    联系电话:+86 15600537884

微信联系我们

小姐姐