字节跳动 STE 团队⾼级系统⼯程师,本科毕业于北京大学计算机系,目前主要参与大规模数据处理在智能运维场景下的应用,涉及内核、编译等相关研发和优化工作,为业务提供更精细化、专业化的性能优化服务。参与的项目服务于字节跳动百万级规模的数据中心(涵盖物理机、多云环境)的业务性能优化、硬件选型优化及硬件自研指导,为数据中心的硬件定制化、硬件自研及数据中心成本优化提供技术和数据支撑及落地。
在当前的互联网大规模数据中心中,CPU 是仍然是算力的主力,但这些 CPU 每时每刻在运行什么类型的工作负载、运行在什么库及函数里,比例是多少,微架构使用特征是什么,这些信息无论是对于业务侧的性能优化,还是硬件定制化和深度芯片自研都至关重要。 业界如 Google 在十几年就开始了这项工作,我们从一些论文中能够知道其大致的实现思路。
随着数据规模的膨胀及硬件技术的飞速发展,越发需要对百万级甚至更大规模的数据中心进行算力监控和剖析,最大程度上降低 TCO。在参考了业界现有的实现方式后,字节跳动数据中心根据自身业务情况做出了一些创新,交叉融入内核、编译、智能运维等多项新技术,实现了一套对业务无损的常态化算力监控分析系统,涵盖物理机和多云环境。
目前,该系统部署近一年时间,运行良好,为业务性能优化和硬件自研探索提供了非常有价值的输出,成功用于业务性能优化、芯片探索性建设。在本次演讲中,我们愿意把经验分享给各位同行。
演讲提纲:
1. 需求背景
2. 业界解决方案及痛点
3. 核心解决思路
4. 项目落地
5. 主要产出
6. 未来展望
你将获得:



微信咨询

电话咨询
微信联系我们

