核心观点
本文针对机器狗视觉系统视角低、动态手势识别准确率不高、真实场景环境变化等问题,设计了适用于机器狗视觉交互场景的手势识别算法。
关键数据
- 数据集: 本文构建了面向机器狗视觉系统的动态手势数据集 XD-RDV18,包含前进、后退、向左、向右和停止五种手势动作,共450个视频样本。
- 实验结果:
- TSl3D 模型相较于 13D 算法和 Two-Stream 算法,在 RGB、光流和 RGB+光流数据输入下均取得了更高的识别准确率,分别提升了 10.18、5.26、6.51 个百分点。
- NL-TSl3D 模型相较于 TSl3D 模型,在 RGB、光流和 RGB+光流数据输入下均取得了更高的识别准确率,分别提升了 1.08、1.27、1.77 个百分点。
- 迁移学习实验表明,经过预训练学习的网络参数,模型最终的准确率得到显著的提升,在 XD-RDV18 数据集上进行实验,准确率最高可达 92.74%。
研究结论
- TSl3D 模型能够有效提取动态手势视频中的时序信息,提高识别准确率。
- 非局部注意力机制能够缓解卷积神经网络中长距离特征信息难以相互关联的问题,进一步提升识别效果。
- 本文提出的方法能够有效应用于机器狗视觉系统,实现对机器狗的控制。
未来工作展望
- 提升算法的泛化能力,使其能够适用于更复杂的现实场景。
- 利用多模态数据进行手势识别,解决手势遮挡等问题。
- 减少模型的参数量,降低对标记数据的依赖。
- 充分考虑手势的整体特征和局部特征,提高手势特征的表达能力。
- 解决手势跟踪和负样本识别等问题。