您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 东吴证券:《小鹏集团:第二代VLA开始拥有“时间感”,物理AI体系进入复利期》-发现报告

小鹏集团:第二代VLA开始拥有“时间感”,物理AI体系进入复利期

2026-09-02 黄细里,童明祺 东吴证券 艳阳天Cathy
报告封面

小鹏集团:第二代VLA开始拥有“时间感”,物理AI体系进入复利期 2026年09月02日 证券分析师黄细里执业证书:S0600520010001021-60199793huangxl@dwzq.com.cn研究助理童明祺 执业证书:S0600125080005tongmq@dwzq.com.cn 买入(维持) ◼8月27日公司发布“TIME|第二代VLA大模型开始拥有‘时间感’”。模型开始理解“时间”——AI理解世界的维度从“3D空间”跃迁至“4D时空”,连接过去、理解现在、推演未来。公司将自身定位为物理AI企业,物理AI最终要解决的是“理解世界,并在世界中行动”,核心命题是在端侧算力、时延、安全与法规的多重强约束下继续scaling。本次OTA6.3.0版本模型更大、记得更久、响应更快、想得更远。 市场数据 收盘价(港元)44.44一年最低/最高价42.66/110.80市净率(倍)2.73港股流通市值(百万港元)69,656.68 ◼四大底层架构升级:①Infini-VLA让过去的有效信息持续参与当前判断,车端支持最长30秒有效时序;②Streaming Inference流式自回归推理,持续接收新信息实时更新决策,端到端响应速度提升300%;③X-Foresight世界模型+Flow Matching,推演未来6秒内多种可能、生成更自然轨迹;④MoT混合架构,端侧参数量提升3.5倍而不增加算力消耗。黄灯通行、对向博弈、加塞遮挡等长时序场景显著改善。官方口径下,面对遮挡、突然横穿与复杂路口,车辆动作更早、决策更连贯、乘坐更平稳。公司自2025年8月第一代VLA灰度推送以来,半年内连发三个大版本,资源优先投向安全、压实线、导航等头部问题。 基础数据 每股净资产(元)14.10资产负债率(%)73.41总股本(百万股)1,916.14流通股本(百万股)1,567.43 ◼真正的护城河是体系而非单版模型:本次训练数据1.1亿个video clips、时长超100万小时,数据存储规模超1000PB;单次训练数据吞吐量较半年前增长10倍;团队OKR要求问题发生后7天内数据进入训练集。同一基座向上在Robotaxi验证L4(已取得主驾无人道路测试资质、超2000单内测),向下以VLA 2.0 Lite同源蒸馏覆盖更多车型,向外以“oneinfra, two products”打通机器人;Master Agent随OTA 6.3.0上车。MasterAgent可理解复杂意图、拆解任务并调度垂直Agent协同执行;全球化维度,L03慕尼黑上市时德国本地化模型仅用约一周即达上市状态,荷兰、法国、澳大利亚等市场进展将陆续落地——“基座越强,能力上限越高,蒸馏后的能力起点也越高”。 相关研究 《小鹏集团-W(09868.HK):2026年半年报点评:毛利率韧性凸显,机器人融资开启价值重估》2026-08-26 《小鹏集团-W(09868.HK):世界模型登台AI顶会CVPR,物理AI进程加速》2026-06-12 ◼盈利预测与投资评级:我们维持对公司此前的盈利预测,预计公司2026-2028年总营收774/1225/1491亿元,对应2026-2028年归母净利润为-44.25/-12.79/24.33亿元;2028年对应PE为32倍。公司作为集新能源汽车、人形机器人、智驾技术授权、Robotaxi于一体的稀缺物理AI标的,技术底座复利效应逐步显现,后续关注OTA 6.3.0推送反馈、Robotaxi商业化与机器人年底量产节奏,维持“买入”评级。 ◼风险提示:乘用车行业价格战超预期;智驾技术迭代与商业化不及预期;L3/L4政策推出节奏不及预期;人形机器人产业化进展不及预期。 内容目录 1.物理AI的核心命题:在强约束下继续scaling...............................................................................42.第二代VLA OTA 6.3.0:模型开始拥有“时间感”...........................................................................42.1.四大底层架构升级:连接过去、理解现在、推演未来.........................................................52.2.体验落地:动作更早、决策更连贯、乘坐更平稳.................................................................63.一套Infra决定长期进化:数据、体系与延展...............................................................................73.1.数据与AI Infra:1.1亿clips、超1000PB与7天闭环.........................................................73.2. Master Agent上车:整车智能从听懂指令到办成事情...........................................................83.3.一个基座:向上突破、向下覆盖、向外延展.........................................................................84.投资建议..............................................................................................................................................95.风险提示..............................................................................................................................................9 图表目录 图1:物理AI四要素:模型、数据、算力与本体............................................................................4图2:AI理解世界的维度:从“3D空间”跃迁至“4D时空”..............................................................5图3:四大架构在时间轴上的分工:记忆过去、理解现在、推演未来...........................................6图4:第二代VLA版本演进:2025年8月至今半年三个大版本...................................................7图5:第二代VLA OTA 6.3.0关键指标(官方口径).......................................................................8图6:一个基座:向上突破、向下覆盖、向外延展...........................................................................9 表1:第二代VLA OTA 6.3.0四大底层架构升级...............................................................................6 1.物理AI的核心命题:在强约束下继续scaling 公司定位由整车制造商升维至物理AI企业。公司将自身定位为物理AI企业,而非“能造车的自动驾驶企业”或“能做自动驾驶的车企”。物理AI最终要解决的是“理解世界,并在世界中行动”:模型范式奠定方向,模型规模拔高能力上限;数据提供理解真实世界的经验;云端与端侧算力分别支撑训练和实时运行;本体让AI进入真实世界持续验证。 物理AI在输入、输出与约束条件上均与数字AI存在本质差异。输入端,物理AI处理的是高密度、连续的视频流与多路传感器数据,信息维度远高于离散token;输出端,控制信号亦是连续的——车辆加速度相差0.01g、起步快慢0.1秒即直接影响安全与体验,机器人操作的厘米级误差即决定任务成败。更为关键的是约束条件:车端模型推理时延需控制在约80毫秒以内、端侧算力有限、安全零容忍、法规要求严格。物理AI的核心命题在于:在多重强约束下继续scaling up intelligence——数字AI的成熟技术与理念大多无法直接迁移,唯有自底层重构。 2.第二代VLA OTA 6.3.0:模型开始拥有“时间感” 本次升级的最大变化,是AI理解世界的维度从“3D空间”跃迁至“4D时空”。一张图片只能告诉模型“这里有个人”,却无法说明他从哪里来、准备往哪里去;感知维度自2D鸟瞰图走向3D空间,本次进一步将“时间”纳入模型——模型不再只看眼前画面,而是让连续发生的信息共同参与判断,连接过去、理解现在、推演未来。“看见世界只需要一瞬间,理解世界需要时间。” 数据来源:小鹏汽车官方公众号,东吴证券研究所绘制 2.1.四大底层架构升级:连接过去、理解现在、推演未来 Infini-VLA:记住更长的道路信息,车端支持最长30秒有效时序。更长时序意味着更多输入通道与更大计算量,且不能牺牲帧率(判断运动状态至少需要三帧方可推出速度与加速度)、不能牺牲参数量;主流开源VLM最多支持两帧输入,难以满足需求。Infini-VLA理论上支持无限长时序,综合训推一致性、训练效率与实际需求,车端推理定为最长30秒有效时序。公司称该重构在业界尚无同类公开工作,架构不予开源;且其训练计算量极大,即使公开架构,同行补齐配套训练基础设施亦需相当时间。 Streaming Inference:流式自回归推理,端到端响应速度提升300%。该架构持续接收新信息并实时更新决策。纯自回归方式对前置状态依赖过强,难以应对前车急切入等突发状况;流式推理带来的300%提升并非单次模型推理时延的等比压缩,而是系统反应速度的整体加快。 X-Foresight+Flow Matching:推演未来6秒内多种可能,生成更自然的驾驶轨迹。该组合将预测性世界模型内嵌进训练,把对未来帧的推演作为更稠密的监督信号,使模型从模仿学习的“下意识反应”走向对世界的理解。Flow Matching作为多峰概率分布拟合器,配合未来预测选择最合理动作并使轨迹更为顺滑。这与公司自2024年科技日以来的技术叙事一以贯之:同一基座模型,一面做动作生成、一面做世界模型,最终走向闭环强化学习。 MoT混合架构:端侧参数量提升3.5倍而不带来线性算力爆炸。与MoE的稀疏激活不同,MoT参数全时激活,按输入模态将token分配至不同专家计算后合并,视觉token跨场景共享,避免任务切换带来的行为风格突变。 2.2.体验落地:动作更早、决策更连贯、乘坐更平稳 长时序与快响应直接转化为可感知的体验改善。车辆能够结合红绿灯变化、交通参与者运动趋势和道路环境,更早作出判断、更快完成响应。以典型场景为例:黄灯通行场景中,时序窗口不足3秒时无法判断黄灯已亮几秒、只能保守停车,升级后可判断能否安全通过;前车倒车出库场景中,过往系统在对方让出空间时即向前顶靠、导致双方僵持,升级后可判断何时该停、何时该走;对向会车场景中,系统可提前预判对方动向并预留空间——“解决脱困最好的办法,是不让自己进入困难状态”。版本节奏上,公司半年内连发三个大版本,