核心观点与关键数据
1. Transformer架构在具身智能中的应用
- Transformer架构凭借其强大的多模态融合能力和高效的并行计算能力,成为具身智能领域的重要技术基础。
- 英伟达COSMOS平台应用:自回归模型和扩散模型通过Transformer架构生成高度仿真的虚拟世界状态,为机器人提供丰富的训练样本。自回归模型采用Transformer解码器架构,依据输入文本和过去视频帧预测未来场景帧;扩散Transformer通过解构和重建训练数据生成细节丰富的虚拟场景。3D RoPE编码空间和时间关系,帮助机器人感知自身与周围物体的位置和动作变化。交叉注意力层结合文本输入,生成符合物理规则的场景。
- 李飞飞团队应用:W.A.L.T模型利用Transformer架构的窗口注意力机制实现图像和视频的跨模态生成与训练,为机器人提供更丰富的环境感知手段。ReKep方法利用预训练的视觉模型和视觉语言模型将复杂的多阶段操作任务分解为多个子目标和路径约束。世界实验室计划基于Transformer架构训练“大型世界模型”(LWMs),支持实时渲染和交互。
2. VLA模型的发展
- VLA模型旨在将视觉信息、语言描述和行动指令进行有效融合和理解,使智能体能够更好地感知环境、理解任务并执行相应的动作。
- Pi公司π0模型与谷歌RT2模型:两者都采用VLA模型架构,π0模型相较于RT2模型有所升级,通过多样化的训练数据和流匹配技术,使机器人展现强大的泛化能力和灵活的操作能力。
- 国内具身智能看VLA后续模型进展:千寻智能通过监督微调、强化学习、模拟学习等技术,实现了业内Top级的灵巧手操作。其ViLa算法利用VLM做机器人的任务规划,展现出了卓越的多样性和极强的泛化能力。星海图强调“大脑”,希望做出可以使用各种形态的,相对通用的机器人,其RSR引擎可以实现基于消费级2D相机不限视角、单次拍摄厘米级、万平米大规模场景的三维几何重建。
3. 力学数据与算法赋能人形机器人触觉感知升级
- 触觉感知在人机交互、虚拟现实、远程医疗和人形机器人研发等领域具有重要研究价值。
- 深度学习驱动的触觉-视觉融合系统:上海交通大学卢策吾团队和刘景全团队提出视觉-触觉联合算法框架,通过触觉与视觉数据融合,实现动态手-物体交互的几何重建与形变追踪。该系统利用触觉手套收集信号,并结合深度相机捕捉的点云序列,实现了动态手-物体交互的几何重建与形变追踪,为机器人柔性操作、虚拟现实力反馈等提供了从微力感知到实时三维重建的完整技术链。
4. 激光雷达技术
- 激光雷达(LiDAR)通过发射激光束探测目标的位置、方位及速度,利用ToF、AMCW和FMCW等测距方法生成三维点云图,实现环境感知。
- 速腾聚创:推出全固态激光雷达E1R和半球形Airy,以及其Active Camera解决方案,显著提升了机器人的环境感知能力。Active Camera融合了激光雷达数字信号和摄像头信息,机器人既能识别精准的三维环境距离信息,又能感知丰富的视觉语义信息。
5. 2D和3D视觉技术
- 2D视觉技术:基于灰度或彩色图像处理,通过像素特征识别物体的纹理、形状及位置,技术成熟且成本低,但计算复杂,适用于简单任务或预算有限的场景。
- 3D视觉实现原理分类及介绍:
- 飞行时间法(ToF):直接ToF(dToF)通过精确测量光脉冲从发射到返回的时间来计算距离,精度高、测距远、抗干扰能力强;间接ToF(iToF)通过发射调制光波,并测量返回光与原始光信号的相位差来计算距离,适合短距离、高精度测量,且成本较低。
- 结构光法:通过向被测物体投射特定的光学图案,并利用图像采集设备捕捉物体表面调制后的光学信息,从而计算物体的三维轮廓信息。分为单次投影成像和多次投影成像两种实现方式。
- 立体视觉法:通过从不同视点获取同一目标场景的图像,并利用视差信息计算目标物体的深度和三维形状。分为双目视觉成像和多目视觉成像两种方式。
- 多种实现方案对比:
- 3D视觉传感器的优势:直接获取深度信息,简化了算法复杂度,增强实时性,在光线变化大、动态物体较多的场景中表现出更强的稳定性。
- 多2D视觉传感器的替代方案:成本更低,但深度计算需要依赖立体匹配、光流法或多视角几何算法,对场景纹理和光照较为敏感,可能会引入误差。
- 关键权衡因素:应用场景、实时性要求、环境条件、计算资源、成本与维护。
6. 投资建议
- 全面看好具身智能+Ai领域,Ai有望赋能多个产品形态的机器人+多个新兴创业公司,产业参与者将涉及更多领域,机器人领域的软/硬件工程师红利有望持续兑现。
- 关注和Ai+具身智能研发方向重合且具备稀缺卡位优势的公司,如兆威机电、奥比中光、福莱新材、日盈电子、安培龙、峰岹科技、中坚科技、中大力德等。
7. 风险提示
- 具身智能相关模型算法进步不及预期。
- 机器人技术迭代路线出现变化。