登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
其他报告
/
报告详情
生成未必理解:基于扩散模型能否实现视觉世界模型?
2025-03-21
腾讯
生产-肖徐-审核报告小号
核心观点
:视觉生成与视觉理解目前存在割裂,生成未必理解,理解无法生成;两者建模方式、参数规模均不同,视觉理解依赖LLM,视觉生成依赖扩散模型。
发展历程
:视觉生成基于扩散模型发展迅速,从DDPM到LDM,再到Stable Diffusion等,应用广泛;视觉理解则依赖LLM,如DALL-E、CogView等。
世界模型路径
:未来世界模型的实现需要统一多模态理解和生成,多模态大模型是关键,代表性工作包括LanguageBind、MoH、MoE++、Flow-World、AR-World等。
Open-Sora Plan
:团队提出256倍压缩的3D因果VAE、任意分辨率及时长训练等技术,开源计划获得GitHub Trending全球榜单第一,持续更新近半年,累计新增代码8万余行。
视觉世界模型探索
:包括相机位姿先验4D生成和全景3D生成,前者输入相机位姿构建不同视角的4D世界,后者输入全景二维信息构建3D全景世界。
视觉生成架构
:自回归Transformer可能成为统一架构的关键,但目前生成架构仍未收敛到Diffusion,存在自回归Transformer与Diffusion的竞争。
统一框架挑战
:视觉理解和生成的Encoder是否需要统一、离散与连续的选择、TaskConflict和GradientsConflict的处理、视觉CoT的加入等问题需要解决。
统一框架方案
:自回归Transformer统一架构,理解和生成在同一主干网络中端到端训练;MoE、MoH架构对于原生统一至关重要;高效注意力机制是关键。
多模态CoT增强
:LLaVA-CoT/o1模型开源,首个视觉多模态慢思考模型,有助于提升生成和理解精度。
争议点
:统一Loss还是统一建模方式?视觉模态选择连续还是离散?
研究结论
:自回归Transformer可能是大统一的关键,类Sora架构意义重大,但路线之争(Loss统一或建模方式统一、视觉模态选择)仍需解决。
你可能感兴趣
超越自回归视野:对扩散模型、世界建模和状态空间模型在代码生成领域的全面调研
信息技术
IBM
2026-04-09
扩散模型如何做好可控生成?基于奖励引导的控制生成用于扩散模型中的推理时对齐:教程与综述
文化传媒
未知机构
2025-01-20
【机构龙虎榜解读】多模态+AI视频+短剧+抖音电商,与巨量引擎签署数据推广合作协议,基于自研营销领域专用的AIGC多模态模型,已实现图片、视频等多种形式的智能化内容生成,这家公司获净买入
未知机构
2023-12-12
基于物理条件约束的可信视觉生成大模型
信息技术
朱思语
2025-03-31
基于物理条件约束的可信视觉生成大模型
信息技术
2024AI研发数字峰会AiDD北京站
2024-11-17
传媒行业周报:谷歌更新视频生成模型Veo 3.1,阿里通义千问推出其最强视觉语言模型系列
信息技术
国盛证券
2025-10-19
ICML 2026杰出论文任意顺序迷思扩散语言模型生成顺序灵活性
未知机构
2026-07-23
3-4 基于事件图结构的文本-视觉理解
信息技术
DataFunSummit2022:图机器学习峰会
2022-07-18
影视传媒行业周报:谷歌发布AI世界模型Genie,AI视频生成平台LTX Studio已推出
文化传媒
西南证券
2024-03-02
传媒互联网产业行业周报:豆包视觉理解模型发布,关注税收优惠政策延续的影响
文化传媒
国金证券
2024-12-22