关注大模型应用、云原生应用的性能优化思路,构建出更加高效、稳定的应用,满足不断增... 展开 >





关注大模型应用、云原生应用的性能优化思路,构建出更加高效、稳定的应用,满足不断增长的业务需求。
大型语言模型 (LLM) 凭借其卓越的能力吸引了来自工业界和学术界的广泛关注。然而,一个主要障碍在于,现存的大部分 LLM 研究和开发工作都依赖于 GPU,但价格昂贵且供應有限并非人人得享用。为了弥合这一差距,我们正在积极致力于让一些流行的 LLM 框架能够高效地运行在 CPU 上。这将使这些强大的工具能够被更广泛的使用,最终加快大型语言模型领域的进步。在这次演讲中,我们以 vLLM 为例,分享我们在 Intel Xeon 上实现最大化应用程序性能的最佳实践。
The world of Large Language Models (LLMs) has sparked significant interest in both industry and academia due to their remarkable capabilities. However, a major hurdle exists particularly in China: most current LLM research and development relies heavily on GPUs, which are expensive and not always accessible. To bridge this gap, we are actively working on enabling some popular LLM frameworks to run efficiently on CPUs. This will make these powerful tools more accessible to a wider range of users, ultimately accelerating advancements in the field of LLMs. Using vLLM as an example, we share our best practices to maximize inference performance on Intel Xeon.
演讲提纲:
1. vLLM 是業界領先的开源服务框架
2. Intel® 与 vLLM 社区合作集成 vLLM 在Xeon® 服务器的開發和性能优化
3. RFC: https://github.com/vllm-project/vllm/issues/3654
4. 文档: https://docs.vllm.ai/en/latest/getting_started/cpu-installation.html
5. Intel® Xeon® 服务器是 LLM 推理一个不错的选择
6. Q & A
听众收益:
快手电商月购买用户数过亿,上亿粉丝的大 V 直播秒杀期间,单件秒杀商品可能达到数百万件,单品最高秒杀请求达每秒百万次。为了应对大 V 这种不定时、脉冲式的秒杀流量,快手电商交易服务常态化保持较高的系统容量,随着电商业务的不断高速发展,业务复杂度持续升高,接口性能上涨、用户体验变差、系统成本上升等问题也越来越明显。本次分享将介绍快手电商交易如何在百万级并发秒杀下建设高性能的系统架构,降低接口耗时、提升用户体验。并通过一系列系统白盒化的思路优化成本,对计算和存储资源做合理分配和使用,打造交易下单的极致性价比。
随着抖音短视频用户在线人数快速增长,日活跃用户数超过数亿。服务器资源成本压力不断增大,带来延时上涨和用户体验下降等问题,字节服务端大量使用 Golang 作为主力开发语言,性能优化成为一项亟待解决的问题。本次分享将介绍抖音性能分析方法及原理,相关技术细节将涵盖性能分析工具和性能挑战,Go 语言相关技术细节与原理与抖音性能优化案例分析,探索抖音的性能防劣化、成本降低演进之路。使得服务拥有极强的性能和微服务的研发效率。目前性能优化工作已在抖音内部多个业务线中使用,优化核心超过百万核,在不影响研发效率的情况下,带来极强的用户体验。
演讲提纲:
1. 抖音性能分析方法介绍
2. Go 语言性能分析优化建议与原理
3. 性能优化业务案例分析
4. 性能防劣化在字节实践之路
5. 成本降低与性能稳定性的探索分析
听众收益:
方案痛点:
在将业务迁移至不同计算平台或者进行新业务上线的过程中,如何能够完全发挥计算平台的能力,及时找出性能瓶颈并完成优化,这通常需要运维人员有丰富的系统知识和经验。遇到麻烦的 Case,可能需要花费数周时间来对业务反复进行分析、定位、测试、验证。
百度智能云将积沉淀多年的多元 CPU 和多样化业务(在线推广搜、离线大数据、数据库、编解码等)性能调优经验工具化,沉淀出了一套可实现云上业务一键性能调优的应用程序性能诊断工具 Btune,短时间内即可完成性能瓶颈的定位并提供优化建议,极大降低性能调优工作门槛。
本次分享将基于搜索、推荐、仿真等热门场景,深入分享 Btune 性能调优工具在云上业务遭遇的疑难杂症,并详尽阐述我们应对之策和思路。
演讲提纲:
1. 云上业务不同层面的性能问题和挑战
2. Btune 的核心能力技术架构和实现
3. 百度智能云客户业务调优实践
4. 总结与展望
听众收益:
方案痛点:



微信咨询

电话咨询
微信联系我们

