算力革新

会议室:百宴厅3
出品人:吴永巍

AI 时代,数据、算法、算力是三大核心要素,尤其是算力,正在经历一场重构创新的革... 展开 >

专题出品人:吴永巍

百度首席架构师

百度首席架构师(搜索与推荐),百度移动生态技术委员会联席主席,在大规模推荐系统、搜索引擎和分布式系统领域有着十几年的研发经验,当前整体负责百度搜索与推荐架构。2006 年加入百度,长期深耕百度搜索架构、百度 Feed 信息流推荐架构,经历和主持了多个系统规模大幅爆炸下的多次大型架构演进,在搜索引擎、推荐系统、分布式存储与计算、大规模系统进化与调优等领域积累了大量实践经验,并推进了搜索与推荐系统的全面现代化架构进化:全面云原生化、结合混沌工程的稳定性工程变革、软硬结合的算力与数据架构革新、语义技术变革等等。

曾担任百度 2019 年春晚红包项目总架构师,扛住了千万级 QPS 的超高并发,保障了百度春晚活动的稳定顺利完成。

多次行业公开演讲经历,包括 QCon上海2015、QCon上海2019 明星讲师经历。

地点:百宴厅3

专题:算力革新

AI 时代,数据、算法、算力是三大核心要素,尤其是算力,正在经历一场重构创新的革命。

行业不少技术之竞争,本质是在拼算力,尤其是拼算力效率。从最新的 AI 芯片,到新技术涌现的 GPU,从高密度服务器,到更低 TCO 的 ARM 在 IDC 中的更多应用,算力技术革新正在加速推进。同时,软硬件结合,深入业务的极致优化,如何结合异构调度、虚拟化、隔离技术、模型框架、网络互联等技术,提升有效算力,也尤为关键。

本专题将邀请业界一线专家,分享经验,探讨未来。

by 谢汉林

百度
资深研发工程师

近几年随着人工智能的发展和芯片制程进步的变缓,越来越多的人开始关注 AI 芯片。本演讲将结合 AI 芯片行业趋势,介绍百度昆仑芯片的技术特点,分享昆仑在数据中心推理场景的大规模应用案例,包括极致的端到端性能优化,高效的在离线混部等实践经验.

演讲提纲:

1. AI 芯片背景&趋势

2. 昆仑架构及技术特点

3. 昆仑大规模部署实践

4. 未来工作

听众收益:

  • 了解当前AI芯片火热背后的逻辑和行业趋势
  • 了解昆仑的架构设计思路和技术特点
  • 了解云端AI芯片在生产环境的大规模实际应用

by 孙培艺

字节跳动
高级系统工程师

在当前的互联网大规模数据中心中,CPU 是仍然是算力的主力,但这些 CPU 每时每刻在运行什么类型的工作负载、运行在什么库及函数里,比例是多少,微架构使用特征是什么,这些信息无论是对于业务侧的性能优化,还是硬件定制化和深度芯片自研都至关重要。 业界如 Google 在十几年就开始了这项工作,我们从一些论文中能够知道其大致的实现思路。

随着数据规模的膨胀及硬件技术的飞速发展,越发需要对百万级甚至更大规模的数据中心进行算力监控和剖析,最大程度上降低 TCO。在参考了业界现有的实现方式后,字节跳动数据中心根据自身业务情况做出了一些创新,交叉融入内核、编译、智能运维等多项新技术,实现了一套对业务无损的常态化算力监控分析系统,涵盖物理机和多云环境。 

目前,该系统部署近一年时间,运行良好,为业务性能优化和硬件自研探索提供了非常有价值的输出,成功用于业务性能优化、芯片探索性建设。在本次演讲中,我们愿意把经验分享给各位同行。

演讲提纲:

1. 需求背景

  • 集群规模越来越大,算力消耗在什么样的组件甚至是库和函数,这种精细化的分析迫在眉睫
  • 互联网行业的庞大计算规模带动了芯片自研,需要有特征化的输入
  • 找到共性的性能瓶颈,集中化技术革新和优化,能够有效降低 TCO

2. 业界解决方案及痛点

  • 介绍业界方法
  • 目前的痛点

3. 核心解决思路

  • 层次化设计
  • 低开销、低时延的采集模式
  • 工程化处理
  • 实时处理分析

4. 项目落地

  • 框架介绍
  • 采集端
  • 数据中台
  • 系统功能

5. 主要产出

  • 性能优化、芯片自研探索
  • 实时热点函数分析系统
  • 芯片探索性研究的数据输入

6. 未来展望

  • 扩展到 GPU 等加速器
  • 实现对 JIT 部分精确刻画
  • PMU 数据特征的精确业务关联 

你将获得:

  • 对业务无损的常态化算力监控分析系统的方案设计
  • 字节跳动在计算热点剖析系统的技术实践经验
  • 算力监控和剖析优化的发展趋势以及未来前景 

by 吴梓洋

vivo
资深工程师

vivo AI 研究院的业务覆盖了AI各方向,包括语音、视觉、NLP、推荐等,有众多复杂的训练推理场景,对 GPU 算力有海量需求。 GPU 设备成本昂贵,使用门槛高,整体使用率较低。AI 计算平台基于 K8s 搭建了 GPU 集群,并结合一系列开源技术实现了批调度、弹性伸缩和 GPU 算力超卖等核心特性,有效提高资源利用率和降低工程门槛。经过两年的持续迭代,平台建设和落地取得了很大进展,成为 vivo AI 领域的核心基础平台,集群有上千个节点和超过 100 PFlops 的 GPU 算力,同时运行着上千个训练任务和上百个推理服务。

演讲提纲:
1. 背景:vivo AI 业务在 GPU 上的工程痛点

  • 深度学习的推理、训练、开发调试需要大量 GPU 资源
  • GPU 资源成本昂贵和稀缺,但 GPU 资源整体使用率较低
  • 基于 GPU 的深度学习训练和推理的使用门槛较高

2. 整体架构概览

3. 建设实践

  • 离线资源调度的建设实践
  • 弹性伸缩的建设实践
  • GPU 算力超卖的建设实践
  • GPU 集群的高效运维和稳定性保障

4. 总结和展望

你将获得:

  • 了解如何通过 Kubernetes、Kube-batch、KEDA 等云原生技术构建具备批调度、弹性伸缩的 GPU 集群
  • 了解大规模 GPU 集群的高效运维和稳定性保障的实践

交通指南

上海宝华万豪酒店

Shanghai Marriott Hotel Parkview
地址:上海市静安区广中西路 333 号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

小姐姐 小倩