小模型与领域适配模型

会议室:富力1
出品人:秦斌

大模型代表了AI能力的上限,通过更大的尺寸、更多的数据追求更通用的能力。但在场景... 展开 >

专题出品人:秦斌

小米小爱同学技术负责人

秦斌,武汉大学研究生毕业,专注于NLP、搜索、数据等相关技术的研究和应用,在智能助手领域有丰富的实践经验和认识。曾就职于百度,现为小米公司小爱同学技术负责人,负责算法、工程和质量相关的研发工作。主导了小爱同学的技术从传统机器学习、深度学习、 预训练模型、到大模型的迭代升级,使得小爱同学在手机、汽车、音箱、电视等设备上保持体验领先。

地点:富力1

专题:小模型与领域适配模型

大模型代表了AI能力的上限,通过更大的尺寸、更多的数据追求更通用的能力。但在场景落地中,我们往往面临着精度不够、响应太慢、成本太高、受限隐私等问题。希望有经过领域适配后(Domain-Specific Model)的小尺寸模型(Small Language Model)在业务场景下做到“更快、更精、更专业”。

目前小尺寸的模型有着如下的鲜明特点:

  • 模型能力本身也不差,而且在逐渐变得更好。尤其是MoE架构的兴起,既保证了大模型的智商,又获得了小模型的推理速度

  • 更灵活,适配业务更容易,可操作性高

  • 线上推理更经济便宜

本专题深入探讨:

  • 如何通过持续预训练、高质量数据筛选、大模型蒸馏、强化学习、MoE架构等技术提升大模型的专业能力

  • 如何通过模型压缩、显存管理、算子优化、解码优化、系统调度等推理优化技术提升大模型的推理性能;vLLM、SGLang等推理框架的应用经验

  • 如何落地用户手中的设备(汽车、手机、PC)做到隐私安全零延迟的体验

by 王思文

小米
小爱算法工程师

本次分享聚焦 IoT 主动智能中的一个核心挑战:在实时性与小模型算力约束下,如何有效利用超长用户历史行为,提升个性化推荐质量。传统做法受限于上下文窗口与延迟,难以建模长序列模式。我们提出基于用户行为压缩表示的方案,将长历史编码为可解码向量,并通过文本-行为模态对齐训练,使模型真正“读懂”压缩历史;结合领域持续预训练、流式 SFT 与个性化 RL,重点优化推荐时机判断、逻辑一致性与个体偏好对齐。同时构建置信度控制与规则化奖励,解决坏例与反馈稀疏问题。在线效果显示:相较原 CTR 推荐体系,用户覆盖率翻番,建议接受率提升约 35%,点踩率下降 50% 以上;引入压缩表示后,平均 prompt 长度显著下降,p99 时延与单卡吞吐明显优化。实践表明,可解码的历史压缩是小模型实现高质量个性化推荐的关键路径。

演讲提纲

  1. 问题背景:IoT 主动智能的推荐复杂性
    • IoT 操作建议特点:强个性化、设备状态强耦合、存在组合操作
    • 产品约束:强实时(用户进 App 即触发)、高 QPS、成本敏感
    • 传统召回+打分体系的局限非端到端,策略割裂
    • 推荐空间预定义,难以支持组合操作
    • 文案与决策分离,表达能力受限
  2. 核心动机:为什么必须做用户历史压缩
    • 用户历史序列极长,直接拼接不可行
    • 长 prompt 带来:高延迟、高成本、吞吐受限
    • 压缩目标不仅是降维,更是:
    • 保留行为模式
    • 具备可解码语义
    • 支持大模型实时推理
  3. 核心方案:可解码的用户历史压缩表示
    • 将行为序列编码为结构化 embedding
    • 离线计算、在线滑窗加载
    • 与文本 context 联合建模做端到端生成式推荐
    • 关键技术一:文本-行为模态对齐
      • 信息恢复 / 全局关联 / 行为预测三类任务
      • 验证 embedding 的可解码性
      • 踩坑经验:未对齐时压缩表示会被当作噪声
    • 关键技术二:领域持续预训练(CPT)
      • IoT 行为语料构建
      • 只对操作 token 计算 loss
      • 在参数规模不变下取得显著收益
    • 关键技术三:流式 SFT 与数据闭环
      • 多维分层采样
      • LLM 参与数据质量过滤
      • 形成数据-模型正循环
    • 关键技术四:面向业务约束的 RL 优化
      • 多目标奖励:逻辑合理性、时机判断、偏好一致性
      • Anchor 策略缓解奖励稀疏
      • 用 RL 精准修复低频高风险 bad case
  4. 工程收益与线上效果
    • 以极低的成本完成大模型对传统方案的全面替代
    • 线上指标:覆盖率翻番、接受率 +35%、点踩率 -50%+
  5. 总结与展望
    • 合理的设计与业务优化可以使小尺寸大模型在特定场景下取得超越超大尺寸大模型的效果
    • 压缩表示是大模型利用长历史的关键路径
    • 在实时推荐中,“更好表示”比“更大模型”更重要

这样的技术在实践过程中有哪些痛点?

  1. 数据与行为理解层面:IoT 用户行为高度稀疏且噪声大,同一操作在不同环境下动机差异明显,仅从行为日志难以还原真实意图;同时大量“无操作”“误触”“被动触发”数据会干扰建模,需要额外的数据过滤与重标记策略。
  2. 压缩表示可用性问题:将长历史压缩成向量后,模型容易把其当作噪声忽略,早期版本离线效果甚至劣于不带历史的模型;如何保证压缩后仍具备可解码语义,是实际落地中的核心难点。
  3. 实时性与成本约束:推荐在用户打开 App 后即时触发,推理延迟与成本受限明显;长 prompt 或大模型方案在工程上难以落地,必须在效果、延迟与算力之间反复权衡。
  4. 反馈信号稀疏:用户对建议的明确反馈比例有限,正负反馈分布不均,直接用于优化容易产生偏差,需要结合规则奖励与间接信号共同建模。
  5. 业务逻辑一致性:IoT 场景存在大量物理与常识约束(如状态冲突、环境不匹配),模型容易生成“看似合理但实际错误”的建议,需要额外的合法性检测与规则约束。

演讲亮点

  1. 可解码的用户历史压缩表示:业界常见做法多是截断历史或做简单聚合特征,难以在长序列下保留行为模式;我们将超长用户行为序列压缩为结构化 embedding,并通过专门的文本-行为对齐训练,确保压缩表示具备可解码语义,能被生成式模型真实利用而非当作噪声。这使小/中模型也能有效利用用户超长历史,在实时与成本可控前提下实现高质量个性化推荐。
  2. 面向真实业务约束的端到端生成式推荐范式:不同于召回+打分+模板文案的流水线体系,我们采用端到端生成式建模,直接在统一框架下完成操作组合生成与文案表达,并结合置信度控制与多目标 RL,使模型同时满足实时性、逻辑合理性与用户体验要求。在真实线上场景中,该范式在覆盖率、接受率与时延指标上均取得稳定收益,验证了生成式推荐在 IoT 场景的可行性。

听众收益

  1. 理解如何在实时与成本受限场景下,通过用户历史压缩表示,让小/中模型有效利用超长行为序列,提升个性化决策质量。
  2. 获得一套可落地的领域适配训练范式经验,包括领域持续预训练、模态对齐、流式 SFT 与 RL 在工业场景中的协同方式。
  3. 看到真实案例证明:小模型在合理的表示设计与训练范式下,在专有领域可以取得不逊于甚至超越超大尺寸通用大模型的效果,为资源受限团队提供可行路径。

by 胡宜峰

网易
计算机视觉算法专家

本次演讲将结合内容风控场景的实践,聚焦“精度、效率、成本、性能”核心问题,从“解决方案、模型、数据、部署”角度出发,充分结合大模型复杂场景理解能力强、泛化能力强、创造能力强的优势,同时结合小模型低成本低时延、定制敏捷、可控性高的特点,打造效果精准、实时响应、迭代敏捷、成本优化、稳定可靠的新一代数字内容风控系统。


演讲提纲

  1. 背景与挑战
    • 精度:通用泛化与领域适配
    • 效率:敏捷迭代与增量更新
    • 成本:数据成本与计算资源
    • 性能:高并发与低时延
  2. 大小模型协同与精度提升
    • 多级动态推理大小模型协同架构
    • 多阶段大小模型蒸馏
    • 领域适配与高效微调
    • 实践效果与案例-复杂风险治理效果提升
  3. 小样本学习与效率增强
    • 属性感知特征描述
    • 多模态小样本原型
    • 幻觉与注意力增强
    • 实践效果与案例-新型风险识别敏捷响应
  4. 数据挖掘与成本控制
    • 可控训练数据生成
    • 多模态半监督学习
    • 基于大小模型协同的主动学习
    • 实践效果与案例-大规模风险管控轻量标注
  5. 动态推理与性能优化
    • 多级动态网络
    • MOE
    • 实践效果与案例-海量风险处理实时性
  6. 未来展望
    • 大小模型发展和应用趋势
    • 数字内容风控未来方向

这样的技术在实践过程中有哪些痛点?

  1. 整体解决方案层面如何设计动态决策机制,用少的计算来处理简单case,用复杂的计算处理困难的case。实现效果与性能的平衡。
  2. 训练数据挖掘与生成,如何同时提升数据的准确性、差异性、有效性。
  3. 异构架构蒸馏,难度较大。
  4. 面向某个单点问题更新,如何不影响全局,实现增量更新。

演讲亮点

  1. 覆盖“效果-效率-成本-性能”全栈视角,全面阐述大模型时代业务场景落地实践。
  2. 聚焦垂直业务场景,分析大模型在通用场景和垂直场景的异同。
  3. 面向现实问题,比如如何增量更新尽量不影响已有能力、如何敏捷迭代缩短周期、如何减少标注节约成本等等。

听众收益

  1. 了解垂直领域与通用领域,大小模型研发应用的异同。
  2. 了解大小模型协同、多模态小样本学习、多阶段知识蒸馏、动态网络等关键技术的实战经验。
  3. 学习下一代AI系统的发展趋势,对未来大小模型的发展方向有一定的了解。

by 董正心

阿里巴巴淘宝闪购
算法工程师

在传统链路中,搜索与推荐链路长期依赖多个垂域独立任务。本次演讲将系统介绍我们如何以大模型为核心,重构统一建模范式:提出面向垂域的 LLM/VLM 重构方案,从重塑任务建模范式、到多任务混合训练设计、高效 Post-Training 强化学习框架,以及分享利用 LLM/VLM 自动生成高质量多模态与文本训练数据的实践方法。通过离线指标与线上收益双重验证,从“各自为战”到“统一智能”的范式升级在垂域AI中的应用价值。最后,突破大模型“高成本、难落地”的瓶颈,形成一套轻量化、可复用的行业落地范式。
 

演讲提纲

  1.  AI改变建模范式:从孤立优化到统一协同
    • 过去,搜推链路中和商品理解自然存在多个NLP子任务,各自独立建模,存在优化方向上的gap
    • 现在,利用LLM的理解和推理能力,实现知识在任务间的迁移与互补
  2. 大模型重塑垂域任务:从拼接组件到原生重构
    • 搜推领域传统NLP任务的llm化重构
    • 商品理解过程NLP任务的llm化重构
  3. 多场景下的数据生成
    • 多种垂域任务的训练数据构造方案
    • 多模态训练数据生成方案
    • 数据飞轮迭代优化数据质量
  4. 垂域多任务LLM/VLM训练
    • 垂域多模态大模型训练方案:知识注入,高效适配应用场景
    • Post-Training强化学习框架(DPO+PPO+RewardModel):提升任务表现
    • 淘宝闪购特色餐零融合训练
  5. 可复用方法论总结
    • 统一建模范式
    • 数据飞轮机制
    • 轻量高效适配

这样的技术在实践过程中有哪些痛点?

  1. 数据生成质量与成本的平衡:LLM生成样本虽缓解标注压力,但必然引入噪声,需通过多轮或多模型校验,设置置信度过滤机制。
  2. 统一模型的精度妥协:在多任务混合训练过程中,整体表现提升的同时可能存在部分任务表现不佳,可通过特异性任务微调继续提升。
  3. 强化学习训练稳定性:多阶段的强化学习对各阶段策略模型的超参数敏感,造成训练效果偏差,需进行严格消融实验验证更优配置。

演讲亮点:

  1. 搜索/推荐/商品理解涉及的多个任务,面向AI大模型重新建模、应用方式分享。
  2. 提供真实业务训练数据的高质高效生成方案。
  3. 提供轻量垂域大模型(LLM/VLM)多任务混合训练方案,全链路垂域落地实践经验分享。

听众收益:

  1. 掌握垂域大模型“轻量化落地”方法:通过Post-Training框架在有限算力下实现性能跃升,避免盲目堆资源。
  2. 获得多任务融合的架构设计实战经验:解决多业务线模型碎片化痛点。
  3. 构建可持续数据飞轮的闭环思维:从LLM生成训练数据到人工反馈迭代,突破冷启动与数据瓶颈。

by 邰康盛

蔚来
主任算法工程师

针对通用基座大模型在汽车销售垂类场景中存在的领域知识匮乏与专业能力短板,难以完全匹配业务需求的问题,本次分享将深入解析蔚来销售大模型的工程应用和优化实践。我们构建了包含“销售能力定义 -> 高质量数据构建 -> 模型训练与调优 -> 评估与迭代闭环”的完整技术体系,提升大模型在汽车销售领域的核心能力。

演讲提纲 :

  1. 汽车销售大模型能力体系的构建;
  2. 如何从海量原始数据中构造和清洗出用于大模型训练的高质量样本;
  3. 如何基于LLM-as-a-Judge构建可靠稳定的评估Agent;
  4. 如何通过SFT、强化学习等多阶段模型训练方法提升汽车销售大模型的垂类能力;
  5. 如何构建数据-训练-优化-反馈-再到数据的闭环机制。

这样的技术在实践过程中有哪些痛点? 

  1. 真实原始数据的“高噪声”与训练样本“高标准”存在冲突: 如何从海量、非结构化、高噪声的用户历史上下文、用户和销售对话记录、以及销售工作记录中,精准定义并挖掘出符合“金牌销售”标准的正样本是极大的挑战。
  2. 隐性销售能力的“不可量化”与自动化评估的“对齐鸿沟”: 销售能力(如不同用户阶段的销售策略制定等)属于销售能力的隐性知识,具备很强的专业性,同时缺乏类似代码生成的标准答案。

演讲亮点

  1. 如何结合T0基座大模型和销售领域专有知识库,从海量数据中自动构建高质量的销售场景训练样本以及如何构建销售样本库的评价机制。
  2. 如何针对汽车销售场景设计专有的 Reward Function,不同于通用的 RLHF对齐偏好方法,我们从多维度设计了销售大模型在销售能力结果和思考过程的组合奖励,提升垂类大模型的泛化能力。

听众收益

  1. 了解销售垂类大模型 Post-training 的全流程实现途径;
  2. 了解构建高可信的评估 Agent的实操方法论;
  3. 了解销售领域大模型后训练数据飞轮的闭环设计。

交通指南

北京富力万丽酒店

Renaissance Beijing Capital Hotel
地址:北京市朝阳区东三环中路61号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手