背景与现状介绍
召回任务需在时间和计算复杂度约束下,从全量商品库中快速找出与搜索请求潜在相关的商品,平衡性能与效率。当前模型侧存在匹配精准度低(尤其中长尾query/sku)、交互不充分的问题;索引侧存在部署成本高、推理精度损失大、索引更新成本高等问题。
索引侧改进方向
- 两阶段训练模式优化:从稠密检索两阶段转向生成式检索一阶段,减少链路损失。
- 索引轻量化:采用hash索引或轻量级索引替代例行大索引。
- 模型交互增强:利用生成式检索实现隐式深度交互,提升性能上界。
- 大模型特性利用:借助大模型的scaling law提升表达能力和泛化能力,缓解中长尾问题。
Lexical-based方法分析
领域特性与挑战
- 位置无关、局部敏感、信息冗余。
- 训练任务较难,搜索空间大,生成非商品率高(query太短时)。
- 传统问答相反,输入多输出少,多样性要求高,生成空间大,准确率低。
实验结果
- GenR-PO + SFT vs RSR:中长尾提升较多,头部较弱。
- GenR-PO + SFT vs DPO(wcons):偏序学习后中长尾优势仍在,头部差异减弱,recall@1000指标相当。
- GenR-PO + SFT vs DPO(w/ocons):约束性生成优于不加约束的DPO。
- q2t/t2q vs query2multi-span:原始Title噪声多,重定义任务关键;适当增加span数量和长度、调整Beamsize效果较好。
SemanticID-based方法分析
方法与难点
- Lexical-based劣势:生成token数多时推理慢、存储占用大。
- SID-based难点:依赖生成SID的表征质量。
实验设计
- RQ量化:基于用户信息、历史交互和搜索关键词预测最可能购买商品。
- 残差聚类分析:
- 三层残差聚类呈现沙漏结构:层数增加,残差减小,聚类效应减弱。
- 语义ID构建后路径稀疏性增加,非均匀分布现象加剧。
- 对比实验:
- 基本对比:头部token数量显著大于长尾token。
- 进阶对比:交换一二层后,给定第一层token显著增加。
- 变长式自适应移除大路由节点层,启发式直接去除大路由节点层。
未来展望
- 表征优化:提升特征表示质量。
- 时效特征:融入时间维度信息。
- 基于大模型的生成式召回-排序框架:进一步结合大模型能力优化召回排序效果。