大模型推荐系统研究总结
1. 推荐系统与大模型技术背景
推荐系统通过用户历史行为数据学习用户模式并预测未来行为,但面临数据稀疏和冷启动问题。大模型技术具有涌现能力,参数规模超过阈值时模型精度剧增。
2. 大模型推荐优势
相比传统推荐系统,大模型推荐具备:
- 更强的泛化性:依赖零/少样本推理快速适应新任务
- 更好的表征建模能力:提取高质量文本表示,利用世界知识完善理解
- 更强的个性化内容生成:生成不受限的个性化内容且可解释
3. 传统大模型推荐方法
3.1 大模型生成表征+推荐系统
- 利用大模型获取物品高质量嵌入,替代或添加到推荐模型中
- 应用模式包括:大模型嵌入替代推荐嵌入(BIGRec)、嵌入对齐(CTRL、ClickPrompt)
- 挑战:训练与推理时延高、编码对齐困难
3.2 大模型生成文本+推荐系统
- 利用大模型推理能力增强推荐辅助信息
- 应用模式包括:提炼联想新信息(KAR)、开放域知识引入(CTRL)
- 挑战:额外推理时延、依赖提示模板质量
3.3 大模型生成推荐结果
- 通过预训练LLM与推荐任务对齐直接生成推荐结果
- 应用模式包括:提示工程(TALLRec、KP4SR)、推荐模型嵌入融入(LLaRa)
- 挑战:难以生成可控结果
3.4 传统大模型推荐挑战
- 数据层面:缺乏推荐相关预训练数据
- 模态角度:难以捕获协同信息
4. 生成式推荐大模型
4.1 研究方向
- 将传统推荐小模型做大做深,具备scaling law
- 具备通用大语言模型的涌现能力,深度挖掘用户与物品关联
- 主要研究方向:ID特征的索引与建模、高效训练与推理
4.1.1 ID特征的索引与建模
- 基于语义embedding获取语义ID替代无意义物品ID
- 方法包括:等贡献码本、层次化码本
- 挑战:信息损失、协同信息缺失
4.1.2 高效序列转换架构
- 将推荐任务重构为Seq2Seq序列生成任务
- 设计基于Transformer的架构并优化效率
- 挑战:长序列处理能力、时间复杂度优化
5. 大模型推荐方法归纳总结
5.1 训练方式归纳
- 判别式大模型推荐:直接优化推荐任务
- 生成式大模型推荐:通过生成中间表示辅助推荐
- 未来研究方向:模型无关与模型感知的混合范式
5.2 相关工作与数据集
- 代表性工作:BIGRec、CTRL、TALLRec等
- 公开数据集:仍需更多文本信息丰富的数据
6. Data-centric大模型研究
6.1 数据重生成
- 面向序列推荐的数据集重生成方法(DR4SR)
- 模型无关阶段:学习重生成器,重生成数据集
- 模型感知阶段:目标模型评估重生成数据
- 优势:跨模型结构泛化能力,体现Data-centric与Model-centric互补性
6.2 EntropyLaw
- 数据压缩与模型智能的紧密关联
- 数据质量评估维度:数据压缩率、训练损失、数据一致性、平均数据质量
- 基于EntropyLaw的数据选择算法(ZIP)
- 实验验证:压缩率越低模型效果越好,压缩率接近时损失和效果接近
7. 推荐Scaling Law初探
7.1 研究背景
- 模型规模提升需高成本,需研究规律指导训练
- 现有分析缺乏定量比较
7.2 数据规模、模型规模对Loss的影响
- Scaling law拟合分析:loss与模型层数、嵌入维度、数据规模成反比
- 基于数据熵的进一步分析:近似熵越低数据质量越高,拟合参数与数据规模/近似熵成反比
7.3 数据规模、模型规模对推荐性能的影响
- 最优模型参数正比于模型层数与嵌入维度的乘积(O(LD))
- 更大规模数据集需匹配更大规模模型
8. 多行为推荐大模型
8.1 研究背景
- Scaling Law表明大模型需更多训练数据
- 单行为数据难以满足需求
8.2 混合多个行为数据的影响
- 行为数量越多数据量越大,推荐性能通常越好
- 单纯堆叠行为可能产生负面影响
8.3 行为相似度角度分析
- 加入低相关度行为可能产生负面影响
- 未来需通过相似度等方式进行数据选择
8.4 行为可知的多行为推荐大模型
- 显式建模行为类型可稳定提升性能
- 考虑加入更多特征是可行方向
9. 总结与展望
- 大模型成为驱动推荐系统发展的新动力
- Data-centric人工智能:Entropy Law揭示数据压缩与模型智能关联
- 推荐大模型发展方向:
- 推荐领域的scaling law提供训练指导
- 考虑多行为数据及多样特征
- 提高训练推理效率