登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
张祺深_支付宝搜索的Query理解与语义召回技术_DataFun分享
信息技术
2023-08-08
DataFunSummit2023:大模型与AIGC峰会
刘银河
移动APP时代搜索场景的变化和挑战
搜索内容的变化
:从传统搜索引擎的网页和文档,转向移动APP中的商品、门店、视频、小程序、账号载体、股票基金等多样化内容。用户Query难以完整表示被检索内容,更注重语义相关性。
结构化信息检索问题
:检索内容中,文本信息较少但具有结构化信息(如商品的品牌、类目,小程序的意图、功能,基金的类型、经理人等)。挑战在于如何将用户Query与检索Item的结构化信息进行综合语义匹配。
多属性语义匹配算法
:通过多属性文本表征、多属性匹配任务、联合匹配概率建模和整句embedding表征优化等方法,融合不同属性文本信息,提升语义匹配准确率。具体步骤包括:
C1:多属性文本表示
:将每个属性的token embedding进行first-last layer average pooling作为属性表征。
C2:多属性间文本匹配
:计算query对每个属性的attention weight,使用对比学习InfoNCE Loss优化query与多属性表征的相似度。
C3:语义向量融合表示
:利用query与item之间的余弦相似度作为相关性得分,通过对比学习优化query与整句embedding表征的相似度。
生成式的层次化文本多分类样本增强
Query文本分类问题
:Query文本分类是召回、相关性、排序的重要特征,但面临大规模层次化文本分类(分类节点1000-100万)和样本稀缺的挑战,人工标注成本高。
层次化文本多分类样本生成的挑战
:生成样本的label需准确,多样性需保证。方法包括:
C1:label语义和关键词短语增强的prompt
C2:融入label层级信息的关键词抽取器
C3:过滤模块(类似CF training过滤)
C4:通用生成式样本增强框架
实验效果
:对比不同Backbone模型下不同生成式样本增强方法的效果,包括EDA(基于规则的增删改)、BT(反向翻译)、LAMBADA、GDA、PromptGDA等。
大模型时代还留给了搜索哪些NLP问题?
大模型目前的局限性
:生成结果准确性、在线服务耗时、实时信息获取能力不足。
对应的NLP问题
:大规模语义检索任务、大规模文本分类任务。
你可能感兴趣
“学海拾珠”系列之二百七十五:基于大语言模型的语义引导搜索Alpha因子
信息技术
华安证券
2026-06-01
语义模型在小红书社区搜索的应用
文化传媒
DataFunSummit2023:大模型与AIGC峰会
2023-08-08
知识增强的视频语义理解评测报告
百度
2022-11-07
国盛:张军:理解中国经济:上一程的终结与下一程的挑战-2019资本市场年会纪要20190109
国盛证券
2019-02-09
成长股投资的理解与分享-电话会纪要
未知机构
2022-05-24
张倩-CDW PG大规模在线数仓技术构架分享
信息技术
ArchSummit北京2022|全球架构师峰会
2022-11-02
WIPO Re: 搜索 : 在抗击被忽视的热带病方面分享创新
WIPO
2015-10-01
2025年面向 6G 的语义通信技术研究报告
信息技术
北京稻壳科技&IMT-2030(6G)推进组
2025-11-01
基于连续语义增强的神经机器翻译技术
达摩院
2022-10-12
2019年三季报点评:业绩符合预期,大数据和语义智能技术的应用落地
信息技术
国信证券
2019-10-25