本次分享聚焦 IoT 主动智能中的一个核心挑战:在实时性与小模型算力约束下,如何有效利用超长用户历史行为,提升个性化推荐质量。传统做法受限于上下文窗口与延迟,难以建模长序列模式。我们提出基于用户行为压缩表示的方案,将长历史编码为可解码向量,并通过文本-行为模态对齐训练,使模型真正“读懂”压缩历史;结合领域持续预训练、流式 SFT 与个性化 RL,重点优化推荐时机判断、逻辑一致性与个体偏好对齐。同时构建置信度控制与规则化奖励,解决坏例与反馈稀疏问题。在线效果显示:相较原 CTR 推荐体系,用户覆盖率翻番,建议接受率提升约 35%,点踩率下降 50% 以上;引入压缩表示后,平均 prompt 长度显著下降,p99 时延与单卡吞吐明显优化。实践表明,可解码的历史压缩是小模型实现高质量个性化推荐的关键路径。
演讲提纲
- 问题背景:IoT 主动智能的推荐复杂性
- IoT 操作建议特点:强个性化、设备状态强耦合、存在组合操作
- 产品约束:强实时(用户进 App 即触发)、高 QPS、成本敏感
- 传统召回+打分体系的局限非端到端,策略割裂
- 推荐空间预定义,难以支持组合操作
- 文案与决策分离,表达能力受限
- 核心动机:为什么必须做用户历史压缩
- 用户历史序列极长,直接拼接不可行
- 长 prompt 带来:高延迟、高成本、吞吐受限
- 压缩目标不仅是降维,更是:
- 保留行为模式
- 具备可解码语义
- 支持大模型实时推理
- 核心方案:可解码的用户历史压缩表示
- 将行为序列编码为结构化 embedding
- 离线计算、在线滑窗加载
- 与文本 context 联合建模做端到端生成式推荐
- 关键技术一:文本-行为模态对齐
- 信息恢复 / 全局关联 / 行为预测三类任务
- 验证 embedding 的可解码性
- 踩坑经验:未对齐时压缩表示会被当作噪声
- 关键技术二:领域持续预训练(CPT)
- IoT 行为语料构建
- 只对操作 token 计算 loss
- 在参数规模不变下取得显著收益
- 关键技术三:流式 SFT 与数据闭环
- 多维分层采样
- LLM 参与数据质量过滤
- 形成数据-模型正循环
- 关键技术四:面向业务约束的 RL 优化
- 多目标奖励:逻辑合理性、时机判断、偏好一致性
- Anchor 策略缓解奖励稀疏
- 用 RL 精准修复低频高风险 bad case
- 工程收益与线上效果
- 以极低的成本完成大模型对传统方案的全面替代
- 线上指标:覆盖率翻番、接受率 +35%、点踩率 -50%+
- 总结与展望
- 合理的设计与业务优化可以使小尺寸大模型在特定场景下取得超越超大尺寸大模型的效果
- 压缩表示是大模型利用长历史的关键路径
- 在实时推荐中,“更好表示”比“更大模型”更重要
这样的技术在实践过程中有哪些痛点?
- 数据与行为理解层面:IoT 用户行为高度稀疏且噪声大,同一操作在不同环境下动机差异明显,仅从行为日志难以还原真实意图;同时大量“无操作”“误触”“被动触发”数据会干扰建模,需要额外的数据过滤与重标记策略。
- 压缩表示可用性问题:将长历史压缩成向量后,模型容易把其当作噪声忽略,早期版本离线效果甚至劣于不带历史的模型;如何保证压缩后仍具备可解码语义,是实际落地中的核心难点。
- 实时性与成本约束:推荐在用户打开 App 后即时触发,推理延迟与成本受限明显;长 prompt 或大模型方案在工程上难以落地,必须在效果、延迟与算力之间反复权衡。
- 反馈信号稀疏:用户对建议的明确反馈比例有限,正负反馈分布不均,直接用于优化容易产生偏差,需要结合规则奖励与间接信号共同建模。
- 业务逻辑一致性:IoT 场景存在大量物理与常识约束(如状态冲突、环境不匹配),模型容易生成“看似合理但实际错误”的建议,需要额外的合法性检测与规则约束。
演讲亮点
- 可解码的用户历史压缩表示:业界常见做法多是截断历史或做简单聚合特征,难以在长序列下保留行为模式;我们将超长用户行为序列压缩为结构化 embedding,并通过专门的文本-行为对齐训练,确保压缩表示具备可解码语义,能被生成式模型真实利用而非当作噪声。这使小/中模型也能有效利用用户超长历史,在实时与成本可控前提下实现高质量个性化推荐。
- 面向真实业务约束的端到端生成式推荐范式:不同于召回+打分+模板文案的流水线体系,我们采用端到端生成式建模,直接在统一框架下完成操作组合生成与文案表达,并结合置信度控制与多目标 RL,使模型同时满足实时性、逻辑合理性与用户体验要求。在真实线上场景中,该范式在覆盖率、接受率与时延指标上均取得稳定收益,验证了生成式推荐在 IoT 场景的可行性。
听众收益
- 理解如何在实时与成本受限场景下,通过用户历史压缩表示,让小/中模型有效利用超长行为序列,提升个性化决策质量。
- 获得一套可落地的领域适配训练范式经验,包括领域持续预训练、模态对齐、流式 SFT 与 RL 在工业场景中的协同方式。
- 看到真实案例证明:小模型在合理的表示设计与训练范式下,在专有领域可以取得不逊于甚至超越超大尺寸通用大模型的效果,为资源受限团队提供可行路径。