深度学习极大地推动了遥感图像处理技术的发展,但深度学习模型通常需要大量人工标注的训练样本,且泛化性能相对较弱。近年来,视觉基础模型和大语言模型的发展为遥感图像处理的大模型研究引入了新的范式。基础模型在语言和视觉及其他领域已经得到了广泛应用,其在遥感领域的潜力也正逐渐引起学术界的重视。然而,目前针对这些模型在遥感任务中的全面调查和性能比较仍然缺乏。由于自然图像与遥感图像之间存在固有差异,这些差异限制了基础模型的直接应用。本文从多个角度对常见的基础模型以及专门针对遥感领域的大模型进行了全面回顾,概述了最新进展,突出了面临的挑战,并探讨了未来发展的潜在方向。基础模型在遥感领域的应用框架主要包括视觉基础模型和视觉—语言基础模型。视觉基础模型包括ViT、Swin-T、CoAtNet等,视觉—语言基础模型包括CLIP、mPLUG-owl、ALBEF等。大模型在遥感影像分析中的应用难点主要体现在遥感数据复杂性、图像—文本稀缺性和视觉任务难度三个方面。针对这些难点,研究人员提出了单模态预训练模型和视觉—文本联合训练模型。单模态预训练模型包括有监督单模态预训练模型和自监督单预训练模型,视觉—文本联合训练模型包括针对图像分类、目标检测、语义分割、文字生成和视觉问答等任务的模型。遥感大模型的挑战主要包括数据匮乏、可靠性、时空数据不一致和评估难度。未来,遥感大模型将朝着持续发展大规模数据集、使用基于文本的图像生成的扩散模型、开发特定领域的模型、评估策略和基准提升以及联合学习和迁移学习的应用等方向发展。