登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
世界模型:物理世界的重塑,AGI的终极拼图
建筑建材
2026-07-15
国泰海通证券
Franky!
世界模型:物理世界的重塑,AGI的终极拼图
世界模型发展历程
世界模型经历了五个发展阶段:
理论奠基阶段(1960s~2009年)
:聚焦认知框架与计算理论的早期积累,包括明斯基的框架理论、Johnson-Laird的心理模型等。
工程探索阶段(2010~2017年)
:可规模化训练的动力学与预测模型出现,如PILCO、PredNet等。
技术落地阶段(2018~2021年)
:Ha和Schmidhuber提出基于RNN的世界模型框架,结合隐变量学习与强化学习。
多模态融合阶段(2022~2023年)
:重点推进多模态理解与自监督学习,如JEPA架构,探索与大语言模型结合。
产业探索阶段(2024年至今)
:研发主体扩展至科技企业,技术路线多元化,如生成式路径(Sora)和交互式仿真路径(R-UniAD)。
世界模型核心架构
世界模型主要分为三大架构:
隐式世界建模
:以LLM、VLM和VLA为代表,直接将多模态输入映射为动作输出,降低人工构建环境规则的成本。
潜在动态建模
:通过编码器将高维输入转化为低维潜态,再借助RNN、Transformer等模块捕捉潜态时序演化规律,实现环境动态预测。代表性架构包括RSSM和JEPA。
视频生成式建模
:直接生成像素级视觉输出,为模拟、动作预测与视觉规划提供支撑。技术路径主要有扩散模型和自回归模型。
世界模型与VLA模型
世界模型与VLA模型互补提升决策安全性与效率:
VLA模型
:侧重执行效率,通过端到端架构直接将视觉和语言指令转化为动作,适用于标准化场景。
世界模型
:注重决策推演,预测环境未来变化,评估不同路径风险,适用于复杂场景。
协同路径:
世界模型作为VLA模型的安全护栏与模拟器
:提前模拟动作效果,拦截风险指令。
端到端一体化架构
:将世界模型的预测能力与VLA模型的决策能力深度融合,提升复杂场景决策效率。
世界模型支撑智驾、机器人与视频生成的产业化路径
智能驾驶
产业发展现状
:L2渗透率近70%,城区NOA加速普及,技术路线从模块化端到端向一段式端到端迭代。
传统智驾方案的技术短板
:长尾场景泛化能力弱、未来场景推演不足、复杂环境决策效率低。
世界模型在智驾中的核心价值
:通过生成式仿真破解长尾分布困境,提供独立的安全验证机制,重塑动态博弈意识提升通行效率。
L3级智驾落地面临的挑战
:毫秒级实时响应、物理真实性保障、车端轻量化部署、长程时间一致性。
人形机器人
发展现状
:VLA推动智能化,智驾世界模型跨界赋能,商业化门槛下降。
技术痛点
:物理交互精度低、复杂动作规划能力弱、动态场景适配性差。
世界模型的价值
:辅助仿真到现实迁移,引入物理常识辅助精细操纵,提供长程任务推演场。
量产倒逼世界模型能力升级
:高精度物理建模、跨形态泛化、仿真—现实对齐、多模态融合。
视频生成
行业发展现状
:技术路径从像素拟合转向物理规律建模,国产模型在影视等领域突破。
工业级落地瓶颈
:物理幻觉频发、长视频质量退化、生成过程不可干预。
世界模型切入视频生成
:提升物理仿真、优化长视频跨时空一致性、推动可交互内容生成。
量产的技术路径
:长视频时空连续性、物理对齐、生成效能与成本控制、可控性生成。
世界模型商业化驱动因素和发展瓶颈
商业化驱动因素
落地支撑体系
:数据层从真实采集扩展到仿真混合与合成数据;模型层向Transformer主干收敛,后训练与轻量化技术突破;基础设施层算力支撑体系趋于成熟;工程化层解决世界模型与现有系统的底层兼容问题。
外部环境催化
:产业准入政策放开,生成式AI内容监管框架落地。
商业经济性验证
:成本端减少实物验证与数据采集投入,收入端拓展Robotaxi、人形机器人量产及开放平台服务等模式。
发展瓶颈
高质量物理交互数据稀缺
:真实数据采集成本高,仿真数据存在偏差,视频数据物理交互缺失。
长尾场景泛化能力不足
:真实物理场景分布极不均衡,世界模型缺乏学习极端工况的基础数据。
算力与硬件成本高企
:大模型训练对算力需求高,高端GPU价格持续上涨。
端侧部署精度与实时性矛盾突出
:物理终端算力与内存受限,推理机制灵活性不足,硬件架构碎片化。
国内外代表性世界模型
世界模型产业形成差异化发展路径:
通用型世界模型底座
:以英伟达Cosmos 3、Meta V-JEPA 2、Google Genie 3为代表,专注构建时空连续性、因果推演与物理交互逻辑。
场景仿真型底座
:如Runway GWM-1、World Labs Marble、腾讯HY-World 2.0、阿里HappyOyster等,提供标准化仿真与生成基建。
垂直专用型
:场景锁定于单一垂直域,如自动驾驶(Waabi Copilot4D、Wayve GAIA系列、蔚来NWM等)和具身智能(1X World Model、流形空间WorldScape 0.2、高德ABot-PhysWorld等)。
跨域复用型
:特斯拉FSD World Simulator、小米MiMo-Embodied等,构建横跨自动驾驶与具身智能的统一潜空间。
风险提示
技术成熟度不及预期风险
:行业缺乏统一定义,现有模型存在明显局限。
真实物理数据匮乏与仿真偏差风险
:真实物理数据采集门槛高,仿真引擎存在固有误差。
模型安全与合规风险
:模型安全隐患隐蔽,安全评估工具与验证体系尚不成熟。
商业化落地节奏与商业模式不确定性风险
:预计仍需3~5年持续迭代,商业模式尚不清晰。
你可能感兴趣
世界模型 深度研究 物理世界的重塑 AGI的终极拼图
未知机构
2026-07-26
物理AI的“曼哈顿计划”:世界模型将如何重塑现实世界的认知蓝图? – 华尔街见闻 – -20260507
未知机构
2026-05-07
世界模型驱动的教育AGI白皮书:从认知仿真到教育智能体的范式跃迁
信息技术
天立国际&启鸣达人&天立启鸣AI研究院&Aii
2025-10-13
世界模型与物理AI自动驾驶与机器人的技术进展及路径展望20260421
未知机构
2026-04-21
cosmos世界基础模型平台:面向物理ai的世界基础模型平台
NVIDIA
2025-01-07
跨越奇点:从生成式导向到控制导向的Physical AI基础设施演进——世界模型如何重塑具身智能产业与商业新范式
建筑建材
毕马威
2026-07-01
国泰海通计算机AGI之路 从文本模型到世界模型
未知机构
2026-09-03
世界模型和空间智能铸基,推动物理AI发展
机械设备
国投证券
2026-05-24
计算机行业深度报告世界模型从“生成世界”到“控制世界”,物理AI打开工业软件与自动化重估空间
信息技术
东吴证券
2026-08-27
国泰海通:主权AI时代世界模型与物理引擎竞争分析
未知机构
2026-08-21