在 AI 快速演进的时代,掌握模型训练与微调的能力,意味着你可以真正掌控 AI ... 展开 >





张海俊,科大讯飞高级算法工程师,AI 工程院内核技术部副总监,长期从事语音智能唤醒、语音通用识别、通用神经网络推理框架、深度学习训练框架和超大模型训练相关研究研发,当前主要集中在大模型训练工程优化,深度参与讯飞星火大模型的工程研发。
在 AI 快速演进的时代,掌握模型训练与微调的能力,意味着你可以真正掌控 AI 的核心价值。无论是打造行业专用模型、提升预测精度,还是降低部署成本,模型训练与微调都是实现这一切的关键环节。然后当前模型训练与微调面临诸多挑战,如:数据准备复杂、训练资源消耗大、微调策略多样、评估指标不统一、部署链条长等。本专题将聚焦于模型训练与微调的实战技巧,邀请行业专家分享他们在实际项目中的经验与见解。我们将探讨从数据准备到模型部署的全流程实践,了解模型训练微调的工程优化和效果调优手段,揭示模型训练与微调的最佳实践和未来趋势。
专题可能涵盖的内容:
本次演讲将重点分享飞桨在文心 4.5 系列大模型训练中的性能优化实践,涵盖多模异构 MoE 结构下的工程挑战与系统性解决方案,包括混合并行策略、负载均衡优化、显存效率提升及 FP8 训练等关键技术。
演讲提纲
1. 多模异构 MoE 模型的工程挑战
2. 多模型结构混合并行
3. 分层多模负载均衡策略
4. 极致存算均衡技术
5. FP8 训练与优化
6. 大规模集群训练技术
7. 总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
当前 AI 编程领域正迎来重大变革。传统的 FIM(填充中间)模式已无法满足开发者对复杂编辑操作的需求,AI 编程助手亟需从单一续写能力升级为支持增、删、改全面操作的 NES(下一代编辑与抑制)模型。本次演讲我将系统介绍我们如何通过“全文重写”方案实现 NES 能力,并突破高性能推理、训练数据构建与模型优化等关键技术难题。我们将重点分享 SP Edit 推理方案如何实现 1000+tokens/s 的生成速度,以及如何融合静态代码与动态日志数据构建训练集。此外,针对训练中遇到的回滚、能力冲突等典型问题,我们提出基于 DPO 和 SFT 的优化策略。最后,通过 IDE 回放与 LLM 评测相结合的评估体系,验证 NES 模型的实际效果,并展望其与 Agent 协同工作的未来方向。
演讲提纲
1. 背景与模型演进
2. 推理方案与性能优化
3. 数据构建与迭代
4. 模型训练与优化实践
5. 评测与反馈机制
6. 未来展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
大规模语言模型训练与推理已经进入万亿参数时代,GPU 集群的稳定性与效率成为瓶颈。现有框架如 Megatron-LM 在并行训练中虽能扩展规模,却面临慢节点诊断困难、流水线调度刚性、CPU/GPU 资源耦合严重、可解释性不足等问题。针对这些挑战,算秩未来和上海期智研究院联合研发了 MegatronApp,一个围绕 Megatron-LM 的开源增强工具链,包括:
实测结果显示,GPU 利用率可提升约 25%,传输负载降低 50%,系统整体开销控制在 <2%。本次演讲我将结合具体踩坑案例与优化经验,分享 MegatronApp 在大规模训练场景中的价值与未来展望。
演讲提纲
1. 背景与痛点
2. MegatronApp 的整体方案
3. 核心模块与技术突破
4. 踩坑经验
5. 实践效果
6. 经验总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
腾讯混元开源其国际翻译比赛冠军模型 Hunyuan-MT-7B,该模型参数量为 70 亿,支持 33 种语言和 5 种民汉语言/方言互译,是一个轻量级但能力全面的翻译模型。同时开源的还有业界首个翻译集成模型 Hunyuan-MT-Chimera-7B,它可综合多个翻译模型的结果生成更优翻译,支持接入包括 Deepseek 在内的其他模型。开源不到一周的时间,混元翻译模型登顶 Hugging Face 模型趋势榜第一位。
在 ACL WMT2025 比赛中,Hunyuan-MT-7B 在 31 个语种中获 30 项第一,涵盖常见语种及多个小语种。Hunyuan-MT-7B 在参数受限情况下击败了多个更大规模的模型。在 Flores200 测评数据集上,其表现也领先同规模模型,媲美更大模型。
该模型采用的训练范式涵盖预训练、监督调参、翻译强化等环节。其轻量设计带来多项优势:推理速度更快、支持 FP8 量化进一步提升性能 30%,部署灵活且成本更低,适用于从服务器到边缘设备的多种环境。目前该模型已应用于腾讯会议、企业微信、QQ 浏览器等业务。
本次演讲我将主要介绍腾讯混元大模型团队在混元翻译模型上的训练优化方法。提出大模型翻译能力训练范式,分享在业务应用中的优化经验,希望能给大家带来一些帮助。
演讲提纲
1. 大模型时代机器翻译面临的挑战
2. 大模型机器翻译能力构建
3. 业务应用中遇到的困难
4. 总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

