在传统链路中,搜索与推荐链路长期依赖多个垂域独立任务。本次演讲将系统介绍我们如何以大模型为核心,重构统一建模范式:提出面向垂域的 LLM/VLM 重构方案,从重塑任务建模范式、到多任务混合训练设计、高效 Post-Training 强化学习框架,以及分享利用 LLM/VLM 自动生成高质量多模态与文本训练数据的实践方法。通过离线指标与线上收益双重验证,从“各自为战”到“统一智能”的范式升级在垂域AI中的应用价值。最后,突破大模型“高成本、难落地”的瓶颈,形成一套轻量化、可复用的行业落地范式。
演讲提纲
- AI改变建模范式:从孤立优化到统一协同
- 过去,搜推链路中和商品理解自然存在多个NLP子任务,各自独立建模,存在优化方向上的gap
- 现在,利用LLM的理解和推理能力,实现知识在任务间的迁移与互补
- 大模型重塑垂域任务:从拼接组件到原生重构
- 搜推领域传统NLP任务的llm化重构
- 商品理解过程NLP任务的llm化重构
- 多场景下的数据生成
- 多种垂域任务的训练数据构造方案
- 多模态训练数据生成方案
- 数据飞轮迭代优化数据质量
- 垂域多任务LLM/VLM训练
- 垂域多模态大模型训练方案:知识注入,高效适配应用场景
- Post-Training强化学习框架(DPO+PPO+RewardModel):提升任务表现
- 淘宝闪购特色餐零融合训练
- 可复用方法论总结
这样的技术在实践过程中有哪些痛点?
- 数据生成质量与成本的平衡:LLM生成样本虽缓解标注压力,但必然引入噪声,需通过多轮或多模型校验,设置置信度过滤机制。
- 统一模型的精度妥协:在多任务混合训练过程中,整体表现提升的同时可能存在部分任务表现不佳,可通过特异性任务微调继续提升。
- 强化学习训练稳定性:多阶段的强化学习对各阶段策略模型的超参数敏感,造成训练效果偏差,需进行严格消融实验验证更优配置。
演讲亮点:
- 搜索/推荐/商品理解涉及的多个任务,面向AI大模型重新建模、应用方式分享。
- 提供真实业务训练数据的高质高效生成方案。
- 提供轻量垂域大模型(LLM/VLM)多任务混合训练方案,全链路垂域落地实践经验分享。
听众收益:
- 掌握垂域大模型“轻量化落地”方法:通过Post-Training框架在有限算力下实现性能跃升,避免盲目堆资源。
- 获得多任务融合的架构设计实战经验:解决多业务线模型碎片化痛点。
- 构建可持续数据飞轮的闭环思维:从LLM生成训练数据到人工反馈迭代,突破冷启动与数据瓶颈。