这份研报深入探讨了从LLM(大语言模型)到VLM(视觉语言模型)再到VLA(视觉语言动作模型)的AI技术演进路径。核心内容围绕三者的发展关系、技术机制、数据与表征难度、应用场景以及代表性模型和公司进行了详细分析,揭示了AI能力从文本处理到视觉理解再到物理行动的递进过程。
AI行业正经历从LLM到VLM再到VLA的技术演进,呈现多模态融合、物理世界交互的趋势。LLM以文本为核心,VLM融合视觉与语言,VLA则进一步扩展至动作控制。未来,物理AI将成为关键方向,智能驾驶作为最先跑通闭环的场景,将引领行业应用落地。代表性公司包括OpenAI、Google、NVIDIA等海外巨头以及国内DeepSeek、智元等企业。
研报重点分析了LLM、VLM、VLA的技术脉络与演进路径,包括数据与表征难度逐级提升、应用边界与场景变化、代表性模型与公司布局。同时,报告还梳理了国内外产业映射与竞争格局,指出竞争核心从模型能力延伸至数据、硬件、动作控制与场景闭环,并强调了智能驾驶作为物理世界AI解决方案的重要性。
当前AI市场呈现多模态技术融合加速、头部企业积极布局VLM和VLA的趋势。海外以OpenAI、Google等为主导,国内DeepSeek、智元等企业也在快速跟进。竞争焦点从模型能力向数据、硬件、场景闭环延伸,智能驾驶和机器人领域成为重要赛道。但技术迭代、商业化落地仍面临挑战,需要持续关注行业动态。
研报提示了AI技术迭代不及预期、大模型厂商ARR增速放缓、云服务商资本开支不及预期以及智能驾驶和机器人商业化落地不及预期等风险。技术发展存在不确定性,市场增长可能受限于资本投入和商业化进程。同时,智能驾驶和机器人领域的落地需要克服实时性、安全性等难题,相关进展需持续跟踪。