FinOps 落地

会议室:首府 3
出品人:林昊(毕玄)

FinOps 最关键的价值是降低企业的云成本,从一些实践经验来看,多数企业采用标... 展开 >

专题出品人:林昊(毕玄)

贝联珠贯 创始人 & CEO

在创办贝联珠贯之前,主要工作经历为在阿里的十四年,先后参与,主导设计并带领团队落地了阿里的多轮重要的技术架构演进,主要为从 0 到 1 打造 HSF、作为主要的架构师设计并带领虚拟团队落地阿里电商异地多活、作为主要的负责人设计并带领团队落地阿里的统一资源调度。当前致力于打造一家为客户提供降低超过 30% 云成本的软件及云服务的公司。

地点:首府 3

专题:FinOps 落地

FinOps 最关键的价值是降低企业的云成本,从一些实践经验来看,多数企业采用标准化的产品或通用技术的方式就可以降低超过 30% 的云成本,在企业有更多投入的情况下下降超过 50% 也不难做到。本专题将通过分享实际的优化案例,来看看如何做到不同场景下,有效的做到云成本的大幅下降,同时又不影响业务的稳定性。

by 金李东

涂鸦智能
基础技术负责人

涂鸦智能经历业务高速发展过程中,云成本也经历了野蛮式增长。本次分享主要介绍涂鸦从 2019 年开始着手,结合 AWS 云的特性与产品能力在核心三大方向进行降成本的实践。第一个方向是跨 AZ 内网流量费用,在 AWS 的几乎所有产品中都存在这项费用,为了降低内网流量费用涂鸦进行了微服务架构改造、部署架构调整、以及一系列中间件组件的升级,最终达到基于 3 个可用区部署的前提下仍然达到 80% 以上的流量在同一 AZ 内;第二个方向是计算资源,经历了从虚拟机到 EKS 容器化的自动弹性伸缩,达到资源利用率在 60% 以上;第三个方向是针对数据存储方面,在 IoT 场景下不同的应用场景和特性,对存储方案进行了优化,最终实现了 S3、Aurora 等的成本优化幅度在 30% 到 80% 之间。本次将对以上经验做出分享。

演讲提纲:

1. 背景

  • 涂鸦智能业务及云资源情况
  • 从财务视角管理云资源成本,人人养成具有成本意识

2. 跨 AZ 内网流量治理,微服务架构与中间件组件的适配与高可用的平衡
3. 基于云原生的弹性伸缩调度,让计算资源最大化利用
4. IoT 场景的不同应用场景的最佳存储方案与探索,如何做到 S3 成本降 90%
5. 总结与展望

你将获得:

  • 了解涂鸦智能如何在业务高速发展过程中降低云成本
  • 学习涂鸦智能如何结合 AWS 云的特性与产品能力进行降成本实践
  • 了解涂鸦智能在核心三大方向上的具体实践方式,包括跨 AZ 内网流量费用、计算资源、数据存储方面的优化

by 陆启超

美团
容器平台调度策略团队负责人

本次演讲主要介绍美团通过技术创新和产品优化等多重手段,解决了集群资源利用率提升和服务质量保障这一对集群运营矛盾统一体。通过在集群运营层面落实集群资源利用率运营,实现在不同场景下有效的做到资源利用率提升降低运营成本,同时又不影响业务的稳定性,通过体系化运营实现了为公司降本增效的目标。

演讲提纲:

1. 资源利用率运营的难点与挑战

2. 美团的集群服务质量运营体系(Quality-Cost Ops)介绍

3. FinOps落地实践中的挑战

4. 未来演进方向

你将获得:

  • 集群服务质量运营一些新思路,如何持续在集群运营中资源利用率提升和服务质量保障的矛盾
  • 资源利用率提升和服务质量保障上具体的实践经验
  • 未来集群运营的思路和展望

by 张伟

快手
容器云编排调度引擎团队负责人

随着 AI 技术的不断进步,GPU 资源被越来越广泛的应用在各类业务场景中。在快手,我们使用超大规模的 GPU 卡去支持各种内部业务的算力需求。受制于 GPU 的高成本,大规模管理 GPU 资源并持续提升其效率就成为了关键挑战。快手容器云平台建设了 GPU 虚拟化、GPU 在离线混部和 GPU 潮汐混部等多种平台机制,并结合系列资源运营能力,最终实现了 GPU 日均的显著提升。

演讲提纲:

1. 业务背景与趋势

  • 快手 GPU 资源管理现状
  • GPU 资源提效难点与挑战

2. GPU 虚拟化与在离线混部体系介绍

3. GPU 潮汐混部落地实践分享

4. 持续演进方向与展望

你将获得:

  • 了解快手在 GPU 资源效率持续提升上的系统性建设经验
  • 获取 AI 在线服务和离线训练分时复用算力资源的一些新思路
  • 关于 GPU 资源与服务治理运营的实践优化

by 赵兵

知乎
大数据基础架构开发工程师

在降本增效的大背景下,资源的充分利用成为各大公司关注的焦点。本次分享聚焦于知乎是如何通过技术手段充分利用资源的潮汐特性,解决在线集群资源利用率低和离线资源不足的难题,实现了大量服务器成本的节省。知乎的大数据团队在建设过程中实现了任务画像、统一调度、资源隔离、资源管控、磁盘 IO 隔离和容错处理等机制。实现成本降低的目标,同时保障了业务的稳定性。

演讲提纲:

1. 背景

2. 在离线混部介绍

3. 知乎实践分享

4. 未来演进方向

你将获得:

  • 混部面临的技术挑战与解决方案
  • 大规模 Hadoop 集群与在线集群混部的落地实践
  • 混部场景下,保证业务稳定的思路和展望

交通指南

北京·富力万丽酒店

Renaissance Beijing Hotel
地址:北京市朝阳区东三环中路61号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小姐姐