登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
DeepSeek 基于内容的像谜与排索
文化传媒
2025-02-06
-
-
有梦想的人不睡觉
引言与背景
图像搜索和检索面临挑战,如表达能力受限、设备图像数量限制、元数据误导等。
现有方案(如亚马逊、苹果)存在局限,如需基于图片查询或短语搜索。
随着数字媒体(视频、图像)激增,高效浏览方式需求迫切。
深度学习在图像字幕、机器翻译等领域成功应用,启发本方法。
相关工作
基于内容的图像检索(CBIR)发展历程:
SIFT(尺度不变特征变换)引入不变局部视觉特征。
视觉袋(BoW)模型利用局部特征量化构建紧凑表示,适应倒排文件索引。
现有图像检索方法:
基于手工特征,需用户输入相似图像。
基于文本搜索(如Google),但更多关注文本检索而非语义图像检索。
图像生成描述领域:
使用CNN提取图像特征,生成语义向量用于分类、检测等任务。
本方法将生成描述用于初始化语言模型(LSTM),构建语义理解。
方法
提出端到端图像搜索和检索方法,通过文本查询检索语义相关图像。
两种方法:
基于标题的检索
:
使用预训练ResNet-101提取图像特征。
训练Caption生成模型(MS COCO数据集),将图像转换为语义文本表示。
使用skip-thoughts模型将字幕转换为向量嵌入。
通过最小化查询向量与图像关联字幕向量的L2距离进行检索。
嵌入空间检索
:
使用skip-thoughts模型将图像和文本(用户查询)转换为向量嵌入。
在嵌入空间中通过最小化向量L2距离进行检索。
实验与数据
数据集:
MS COCO:32.8万张图像,每张5个描述,用于训练Caption生成模型。
设置与训练:
Caption生成模型:ResNet-101,Adam优化器,学习率1e-3,指数衰减。
Skip-thoughts模型:无监督学习,用于生成通用句子表示。
嵌入空间检索:使用Caption生成模型和skip-thoughts模型生成的向量进行训练。
评估
Caption生成模型评估:
指标:BLEU、Meteor、ROUGE-L、CIDEr。
结果:与SOTA模型对比,表现良好(CIDEr 1.092 vs 1.270)。
图像检索评估:
指标:Precision@1, @3, @5。
结果:
基于标题的检索:Precision@1 68.3%, @5 91.2%。
嵌入空间检索:Precision@1 72.9%, @5 84.9%。
定性结果:两种方法均能捕捉对象及语义关系(如动物观看电视)。
结论与未来工作
未来方向:
基于三元组损失学习嵌入空间,规范模型语义理解。
整合知识图谱,实现实体推理(如“Hector正在看电视”)。
GPU优化提升检索效率。
结果:两种方法均有效,基于标题的检索表现略优,但嵌入空间检索更具潜力。
你可能感兴趣
DeepSeek:基于内容的图像搜索与检索
信息技术
-
2025-03-01
【电报解读】Meta发布首个“类人”AI图像创建模型,可像人类一样学习更多内容,这家企业与META有业务往来(2)
未知机构
2023-06-15
【机构龙虎榜解读】多模态+AI视频+短剧+抖音电商,与巨量引擎签署数据推广合作协议,基于自研营销领域专用的AIGC多模态模型,已实现图片、视频等多种形式的智能化内容生成,这家公司获净买入
未知机构
2023-12-12
基于内容的图像搜索与检索
UC Berkeley
2018-01-11
据知情人士透露DeepSeek对其计划保持沉默预计不会像去年那样发布重大更新
未知机构
2026-02-03
布局到审查:基于DeepSeek的建筑规划方案双重保障
信息技术
未知机构
2025-04-19
清华大学DS指南:基于DeepSeek的AI音乐词曲创作法
文化传媒
清华大学
2025-05-20
大模型赋能投研之十:基于Deepseek大模型的周报月报全自动生成框架
国金证券
2025-05-07
基于知识增强DeepSeek大模型的医药数字化营销新范式
医药生物
南京柯基数据科技
2025-05-22
基于DeepSeek的AI音乐词曲创作法
新媒沈阳团队&AI音乐人刘东江
2025-02-01