以 ChatGPT 为代表的大模型技术变革,正在以非常快的速度不断进步,并深刻影... 展开 >






张德兵,小红书大模型技术负责人。曾任格灵深瞳首席科学家,快手多模态智能创作负责人,发表顶级学术论文十余篇,带领团队获得包括国际权威人脸识别竞赛 FRVT 世界冠军在内的多项学术竞赛冠军,长期关注CV/NLP/多模态等相关技术。目前专注于大语言模型和多模态大模型的全链路技术研发和应用。
以 ChatGPT 为代表的大模型技术变革,正在以非常快的速度不断进步,并深刻影响着各行各业的创新与发展。大模型不仅仅是数据、算法的进步和突破,同时也考验着整个大规模分布式基础设施, 且 Scaling Law 定律在给未来技术突破带来更大想象的同时,也给基础设施和算力优化带来了巨大的挑战。本专题将聚焦大模型基础设施建设与算力优化这个方向,深入探讨如何搭建稳定高效大模型基础设施,提高各类大模型训练推理过程中的 Scaling 的效率和成本,为一线技术工程师和高级技术管理人员提供前沿知识、一手的实践经验和有深度的技术判断。
本专题讨论的方向涵盖:
通过本专题,参会人员可以了解到最前沿的大模型技术动态,与来自不同行业的专家进行交流合作。我们将结合行业趋势和实践案例,提供深入的行业判断、实用的技术策略和创新的解决方案,帮助从业者更好地解决这些难题,更好地推进大模型技术探索的边界和释放大模型技术的潜力。
多模态大语言模型(Multimodal Large Language Model,MLLM)从大规模预训练中获得图文理解、创作、知识、推理、指令遵循等能力(Capability),通过可监督微调(Supervised Finetune,SFT)激发对应的能力。除此之外,我们还希望模型输出具备特定的风格、符合人类偏好、对齐人类价值观,因此需要引入基于人类的反馈信号的强化学习方法(Reinforcement Learning from Human Feedback),进一步优化模型效果。PPO(Proximal Policy Optimization)算法是 OpenAI 在 RLHF 阶段采用的算法。PPO 算法中涉及到多个模型的协同训练和推理,设计和实现一套高效、准确的 RLHF 训练系统,是关键挑战之一。
本次演讲主要介绍小红书大模型团队自研 MLLM RLHF 训练框架的实现以及性能优化。通过训练和推理的混布调度优化等实现,保证极致的性能,希望能给大家带来一些帮助。
演讲提纲
1. RLHF 的背景
2. RLHF 框架设计和优化
3. 推理引擎优化
4. 实践案例与展望
实践痛点
演讲亮点
听众收益
万卡集群在执行大规模网络模型训练任务时负载重,受到功耗挑战、网络拓扑、可靠性和故障恢复、并行计算、成本分析等多方面的挑战。越来越多开发者希望更好地驾驭万卡集群,提升大规模网络模型在万卡集群训练的集群整体性能。本议题旨在深入探索如何在万卡昇腾 NPU 集群上,基于业界典型 AI 框架和 MindSpeed 分布式并行加速库,结合网络拓扑优化算法和华为开源 HCCL 集合通信库协同优化,将深入剖析万卡集群训练过程中涉及的技术原理和难点,探讨万卡集群训练的性能和稳定性策略,最后结合案例讲解面向万卡集群性能提升的实践。
演讲提纲
1. 万卡集群的核心技术栈
2. 万卡集群可观测数据采集和处理的需求和技术难点
3. 万卡集群的性能提升架构设计
4. 万卡集群的未来展望
实践痛点
演讲亮点
听众收益
随着大型语言模型的社会影响力日益增强,相应的人工智能产品用户基数也在迅速扩大。目前,AI产品发展的一个主要挑战是如何在有限的计算资源下,有效应对日益增长的用户需求。本议题从实际业务出发,探讨在固定集群资源的条件下,通过采用单点和分布式推理架构,提升集群处理大规模请求的能力,过程中遇到的挑战以及我们的解决策略,希望能给大家带来一些帮助和思考。
演讲提纲
1. 大规模推理挑战
2. 单点性能优化
3. 分离式架构 Mooncake
4. 未来展望 - 硬件能力展望
实践痛点
演讲亮点
听众收益
Long-context LLMs Inference的prefilling 阶段由于 Computation bottleneck 造成的长时延 (单卡 A100,1M 8B 约 30 分钟) 给 Long-context LLMs 的应用造成了困难。而 Attention 尤其是Long-context Attention 实际上是非常稀疏且动态的。利用这种动态稀疏性,我们将 Long-context Attention 存在的动态稀疏归纳成三种 Pattern,通过离线搜索出每个 Head 最优的稀疏Pattern,并利用很小的 overhead 在线确定动态稀疏 index,再结合动态稀疏编译器 PIT 和 Triton 进行高效的动态稀疏 GPU 运算,产生实际加速比。我们对市面上主流的 Long-context LLMs , like LLaMA-3-1M, GLM-4-1M, Yi-200K, Phi-3-128K, Qwen2-128K 在RULER,InfiniteBench,Needle Test,LM 等任务中进行了测试,结果显示其具有几乎相同的性能。
本次演讲将主要跟大家分享 LLMs 推理算法侧优化方法,包括量化,剪枝,模型架构优化,FFN 动态稀疏计算等方面的研究和实践。
演讲提纲
1. LLMs 推理算法侧优化方法讨论:如量化,剪枝,模型架构优化,FFN 动态稀疏计算等
2. 长文本 LLMs Inference 遇到的一些挑战
3. 研究思考
4. 解决方案
5. 总结和未来展望
实践痛点
演讲亮点
听众收益
随着人工智能领域的发展,越来越复杂的大型语言模型正在被广泛应用于各个行业,这些模型的推理需求也随之大幅提升。鉴于国际供应链的持续不确定性,我们或将面临因依赖英伟达芯片而产生的潜在风险与挑战。为此,我们采用了英伟达和国产化芯片混合的异构分布式推理方案,该方案将充分发挥两种芯片的优势,确保系统的高效性和稳定性,同时减少对单一供应链的依赖,提升推理能力和自主控制能力。
推理优化已经不局限于算子层面,需要站在系统全局的角度分析并解决问题,需要设计者有全面的技术积累(分布式、算法、算子优化、量化),需要站在异构大集群的背景下思考问题。本次演讲将分享商汤高性能计算与推理团队自研的异构分布式大模型推理系统遇到的挑战以及实现,希望能给大家带来一些帮助和思考。
演讲提纲
1. 异构分布式大模型推理系统优化
2. 多元算力芯片推理优化
3. MOE 的推理优化
4. 大规模异构推理集群的未来展望
实践痛点
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

