豆包视觉理解模型的推出将显著提升AI智能眼镜的交互性,并奠定其在AI载体中的核心地位,同时其低成本特性有望加速AI眼镜的产业化进程。
豆包视觉理解模型具有三大特点:1)强大的内容识别能力,能深入理解关系、空间结构及整体语义;2)强大的理解和推理能力,可基于文字与图像信息进行复杂逻辑推演与计算;3)细致的视觉描述和创作能力。这一模型意味着视觉输入将成为未来AI交互的重要方式,而AI智能眼镜的轻量化、解放双手特性使其成为不可或缺的入口。
关键数据方面,豆包·视觉理解的输入价格为每千tokens 0.003元,比行业平均价格低85%,相当于一块钱可处理284张720P图片,大幅降低AI眼镜的使用门槛,有望加速产业化落地,推动渗透率进入快速提升阶段。2023年全球智能眼镜出货量为智能手表的1%+,渗透率提升空间巨大。
研究结论认为,目前AI智能眼镜的发展进度可对标2014年的智能手表,后续将具有10倍增长潜力。建议关注英派斯、博士眼镜、明月镜片、康耐特光学。