核心观点与动机
GPT-4 实现了高级别的视觉语言能力,如解释模因、从草稿创建网站等,而以往方法如 DeepMind 的火烈鸟或 Salesforce 的 Blip-2 未表现出此能力。其实现机制尚不明确,可能是花式大型数据集、秘密模型架构或先进的大型语言模型。
相关研究
在 MiniGPT-4 之前,ChatCapper 面向丰富图像描述的对话系统,Blip-2 描述图像细节但语言部分不足,ChatGPT 保持询问细节并使用其总结谈话进入决赛描述。
经验与改进
从 ChatCaptioner 中学习到 Blip-2 的视觉部分信息丰富但语言部分需加强,通过仅使 Blip-2 的视觉组件与更好的语言模型对齐可能显著提高视觉-语言指令跟随能力。
MiniGPT-4 设计
使用 Blip-2 的可视编码器并冻结,采用强大的 LLM Vicuna 并冻结,添加线性图层连接模块,输入上下文文本生成响应。
训练阶段
第一阶段预培训:使用传统对齐方法,图像标题数据集 Laion + CC + SBU,输入图像输出标题,使用 4 个 A100 GPU 进行 10 小时培训。但 MiniGPT-4 忘记了自然说话方式。
第二阶段数据集准备:创建小型视觉语言数据集,包含详细的、人类偏好的描述。
第二阶段微调:使用模板进行微调,改进自然说话能力。
演示与能力
演示包括详细描述图像、解释模因、从草稿创建网站、写广告、解释不合理、事实报答、解决问题等。
局限性
与 LLM 类似,MiniGPT-4 面临幻觉问题,不擅长空间信息,无法看到小文本。
结论
MiniGPT-4 通过结合 Blip-2 的视觉编码器和强大的 LLM Vicuna,显著提升了视觉语言理解能力,但仍存在幻觉和空间信息处理等局限性。