登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
大语言模型在计算机视觉领域的应用
信息技术
2024-10-28
冯佳时
AiCon
张博卿
背景介绍
计算机视觉的基本问题包括物体识别、物体分割、图像生成、视频生成和3D生成。
LLM(大型语言模型)作为统一模型,探索生成与理解的统一。
基于LLM的图像理解
LLM在图像理解中的应用存在局限,如缺少细节理解、幻觉等问题。
相关工作提出带定位能力的LLM,但现有模型仅能检测分割单个物体,且效率低。
PixelLM模型
:
模型细节
:使用OpenAI的CLIP模型作为图像编码器,提取多尺度图像特征,设计分割词表,包含多个token组对应不同尺度的CLIP特征。
训练方法
:通过LLM构造训练数据(MUSE数据集),损失函数包含物体分割损失和整体模型损失。
表现
:与LISA模型相比,计算量减少一半,分割精度显著提升(9.6→37.7)。
应用实例
:PixelLM可进行像素级别的图像理解和推理,未来扩展方向包括具身智能对物理世界的理解。
基于LLM的视频生成
当前视频生成模型
:文字描述到视频、扩散模型等方案。
视频生成面临的挑战
:一致性、创作界面与可控性、视频表现力。
新的视频创作流程
:
交互方式
:指定角色和剧本,提高对视频内容的控制。
一致性
:StoryDiffusion模型中的“一致性注意力”模块,保证角色和环境的一致性。
表现力
:StoryDiffusion模型中的“运动生成”模块,在关键画面间生成平滑过渡。
StoryDiffusion的效果
:
运动表现力强,一致性好。
与即梦AI故事模式等已有方法相比,效果更优。
总结展望
LLM在图像理解与视频生成上的初步探索已取得进展。
未来方向:构建基于LLM的统一视觉理解生成模型,开发交互式的多模态LLM模型,实现能与物理世界交互的AI。
你可能感兴趣
大语言模型在法律领域的应用探索
信息技术
极客传媒
2024-10-28
大语言模型在ICT运维领域的研究及应用-datafun
信息技术
DataFunSummit2023:大模型与AIGC峰会
2023-08-08
大语言模型在法律领域的应用探索
信息技术
华院计算&算法实验室
2024-11-15
西部计算机 AI4S在药物研发领域的应用
未知机构
2026-08-12
计算机应用行业跟踪周报:操作系统在计算领域的远期空间有多大
信息技术
东吴证券
2020-07-19
量化分析报告:大语言模型(LLM)在量化金融中的应用展望
民生证券
2023-03-23
大语言模型在投研中的应用:DeepSeek、QwQ-32B与Manus技术解析、投研场景与量化应用
太平洋证券
2025-03-15
多模态大语言模型在富文本图像理解中的应用:全面综述
信息技术
美团
2025-02-23
陈理华-大语言模型在 IT 运维领域的建设落地实践
信息技术
2024 第22届 GOPS 全球运维大会暨 XOps 技术创新峰会 · 深圳站
2024-05-13
从DeepSeek探讨大语言模型在建筑及能源行业的应用趋势和技术方法报告
建筑建材
浙江大学
2025-02-14