性能优化

会议室:国盛厅

关注大模型应用、云原生应用的性能优化思路,构建出更加高效、稳定的应用,满足不断增... 展开 >

地点:国盛厅

专题:性能优化

关注大模型应用、云原生应用的性能优化思路,构建出更加高效、稳定的应用,满足不断增长的业务需求。

by Tony Wu

Intel
机器学习性能高级性能架构师

by 李江

Intel
软件工程师

大型语言模型 (LLM) 凭借其卓越的能力吸引了来自工业界和学术界的广泛关注。然而,一个主要障碍在于,现存的大部分 LLM 研究和开发工作都依赖于 GPU,但价格昂贵且供應有限并非人人得享用。为了弥合这一差距,我们正在积极致力于让一些流行的 LLM 框架能够高效地运行在 CPU 上。这将使这些强大的工具能够被更广泛的使用,最终加快大型语言模型领域的进步。在这次演讲中,我们以 vLLM 为例,分享我们在 Intel Xeon 上实现最大化应用程序性能的最佳实践。

The world of Large Language Models (LLMs) has sparked significant interest in both industry and academia due to their remarkable capabilities. However, a major hurdle exists particularly in China: most current LLM research and development relies heavily on GPUs, which are expensive and not always accessible. To bridge this gap, we are actively working on enabling some popular LLM frameworks to run efficiently on CPUs. This will make these powerful tools more accessible to a wider range of users, ultimately accelerating advancements in the field of LLMs. Using vLLM as an example, we share our best practices to maximize inference performance on Intel Xeon.

演讲提纲:

1. vLLM 是業界領先的开源服务框架

2. Intel® 与 vLLM 社区合作集成 vLLM 在Xeon® 服务器的開發和性能优化

3. RFC: https://github.com/vllm-project/vllm/issues/3654

4. 文档: https://docs.vllm.ai/en/latest/getting_started/cpu-installation.html

5. Intel® Xeon® 服务器是 LLM 推理一个不错的选择

6. Q & A

听众收益:

  •  Help audience better understand pros and cons for running AI vLLM on Xeon
  •  Help audience develop knowledge of LLM inference workload behavior on Xeon
  •  Help audience tune and optimize LLM serving performance on Xeon
  •  帮助观众更好地理解 在 Xeon 平台上運行vLLM的利弊
  •  帮助观众拓展 vLLM 工作负载行为的相关知识
  •  帮助观众开发和优化大語言模型性能,在 Intel Xeon 上获得更好的性能

by 张钦贤

快手
技术专家

快手电商月购买用户数过亿,上亿粉丝的大 V 直播秒杀期间,单件秒杀商品可能达到数百万件,单品最高秒杀请求达每秒百万次。为了应对大 V 这种不定时、脉冲式的秒杀流量,快手电商交易服务常态化保持较高的系统容量,随着电商业务的不断高速发展,业务复杂度持续升高,接口性能上涨、用户体验变差、系统成本上升等问题也越来越明显。本次分享将介绍快手电商交易如何在百万级并发秒杀下建设高性能的系统架构,降低接口耗时、提升用户体验。并通过一系列系统白盒化的思路优化成本,对计算和存储资源做合理分配和使用,打造交易下单的极致性价比。

by 孙荣达

字节跳动
软件开发工程师

随着抖音短视频用户在线人数快速增长,日活跃用户数超过数亿。服务器资源成本压力不断增大,带来延时上涨和用户体验下降等问题,字节服务端大量使用 Golang 作为主力开发语言,性能优化成为一项亟待解决的问题。本次分享将介绍抖音性能分析方法及原理,相关技术细节将涵盖性能分析工具和性能挑战,Go 语言相关技术细节与原理与抖音性能优化案例分析,探索抖音的性能防劣化、成本降低演进之路。使得服务拥有极强的性能和微服务的研发效率。目前性能优化工作已在抖音内部多个业务线中使用,优化核心超过百万核,在不影响研发效率的情况下,带来极强的用户体验。

演讲提纲:

1. 抖音性能分析方法介绍

2. Go 语言性能分析优化建议与原理

3. 性能优化业务案例分析

4. 性能防劣化在字节实践之路

5. 成本降低与性能稳定性的探索分析

听众收益:

  • 了解抖音服务端一些前沿的技术和成果,抖音性能优化体系建设思路
  • 服务端完善性能防劣化体系,确保第一时间感知性能问题
  • 目前微服务领域相关的挑战,从业务逻辑、基础库等层面出发极致优化服务端机器数量,降低服务器成本压力,持续提升用户体验

方案痛点:

  • 覆盖字节大部分服务器,持续提升用户体验,提升服务性能,降低服务器成本与建立较强的稳定性相关建设具备一定的互斥性

by 刘星星

百度智能云
资深研发工程师

在将业务迁移至不同计算平台或者进行新业务上线的过程中,如何能够完全发挥计算平台的能力,及时找出性能瓶颈并完成优化,这通常需要运维人员有丰富的系统知识和经验。遇到麻烦的 Case,可能需要花费数周时间来对业务反复进行分析、定位、测试、验证。

百度智能云将积沉淀多年的多元 CPU 和多样化业务(在线推广搜、离线大数据、数据库、编解码等)性能调优经验工具化,沉淀出了一套可实现云上业务一键性能调优的应用程序性能诊断工具 Btune,短时间内即可完成性能瓶颈的定位并提供优化建议,极大降低性能调优工作门槛。

本次分享将基于搜索、推荐、仿真等热门场景,深入分享 Btune 性能调优工具在云上业务遭遇的疑难杂症,并详尽阐述我们应对之策和思路。

演讲提纲:

1. 云上业务不同层面的性能问题和挑战

  • CPU 架构差异带来的性能问题和挑战(指令集、CPM、Cache、Numa、总线带宽等)
  • 系统调优的问题和挑战(如何适应不同硬件特性,如何适应不同 Workload)
  • 应用调优的问题和挑战(如何准确定位应用瓶颈,最大化资源使用效率)

2. Btune 的核心能力技术架构和实现

  • 性能可视化分析:瓶颈分析的4个维度
  • 瓶颈分析树设计:自动瓶颈定位
  • 一键调优:调优的自动化探索

3. 百度智能云客户业务调优实践

  • 搜索作业:调度和 IO 开销问题定位和优化
  • 仿真作业:指令问题定位和优化
  • 大数据作业:网络问题定位和优化

4. 总结与展望

  • 经验总结
  • 我们现在在做的尝试
  • 未来工作展望

听众收益:

  • 了解云计算各层面的性能问题和挑战
  • 了解云计算各场景性能瓶颈定位、优化建议、自动调优的方法,如何将复杂的性能调优过程自动化
  • 了解云计算不同业务场景的瓶颈点和性能需求

方案痛点:

  • 部分优化手段的实施还无法做到用户透明

交通指南

北京国测国际会议会展中心

GUOCE International Convention And Exhibition Center
地址:北京市顺义区临空经济核心区汇海南路6号院20号楼
  • 微信咨询

  • 电话咨询

    联系电话:+86 17310043226

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手