主要内容总结
1. Transformer架构与具身智能
- 英伟达COSMOS平台:使用Transformer架构生成高度仿真的虚拟世界状态,包括自回归模型和扩散模型。
- 李飞飞团队:推出W.A.L.T模型,利用Transformer架构实现多模态生成与训练,以及ReKeP模型,通过视觉与语言模型结合实现复杂操作任务。
2. 多模态机器学习模型-VLA模型
- 基于Transformer架构的VLA模型:有效融合视觉、语言和行动指令,实现智能体对环境的理解与任务执行。
- 典型模型比较:TO模型和RT2模型均采用VLA架构,TO模型在泛化能力上表现更好,但实时性略逊于RT2模型。
3. 具身智能的后续进展
- 千寻智能:推出Pi0模型,通过训练机器人具身经验,实现端到端的通用趋势。
- 星海图:强调“一脑多形”,希望构建一体化的空间智能模型,实现对物体的三维理解和操作。
4. 灵巧手算法与触觉感知
- 上海交大团队:提出VITaM框架,通过视觉与触觉联合学习实现动态手-物交互的几何建模与形变追踪。
- 触觉手套设计:通过38个区块的力传感道和深度相机采集数据,实现高精度的动态交互感知。
5. 视觉与触觉融合技术
- 视觉-触觉联合算法:通过触觉与视觉数据融合,实现动态手-物体交互的几何建模与形变追踪,促进智能体在人机交互中的理解能力提升。
6. 投资建议
- 关注具备稀缺卡位优势的公司,如灵巧手环节的兆威机电、视觉领域的奥比中光、触觉电子皮肤的福莱新材等,以及机器人创业公司和总成代工企业。