多模态大模型评测体系
发展现状:多模态大模型在图像、文本、视频和音频等信息的综合处理能力不断增强,展现出跨模态理解、高精度识别与理解、强大泛化、丰富表达和增强交互等能力,推动人工智能技术在各行业的广泛应用。图文双模态大模型发展尤为迅速,在内容创作、信息检索、智能决策等场景中取得显著成果。
评测需求:由于不同图文大模型在处理应用场景时各有专长,选择适合各行业特定应用需求的模型变得尤为重要。评测需面向不同任务类型,从各个维度进行综合全面的评测,以评估图文大模型的真实性能和用户体验。评测需求包括识别、理解、创作、推理四种任务。
评测挑战:图文大模型的高泛化性对评测任务选取提出挑战;高复杂度对评测数据构建提出更高要求;评价结果的客观性也需要重点考虑。
评测方式:主要包括客观评测和主观评测两种。客观评测利用客观评价指标对图文大模型的生成结果进行定量评估,如准确率、召回率、模型推理时间等;主观评测通过人工打分的方式对图文大模型的预测结果进行评价,主要应用于创作类任务。
评测维度:可分为模型性能、模型泛化能力、模型鲁棒性和模型一致性四个方面。
评测指标:常见指标有准确率、F1值、BLEU、IS指标、CLIP相似度、PSNR、SOA、CIDEr、mAP、IoU、FID、SSIM、RP、碳足迹等。
典型评测体系:MMBench、OCRBench、智源评测体系、LLaVA-Bench、VisIT-Bench、SEED-Bench、ConBench等。
“弈衡”评测体系:采用“2-4-6”层级架构,包含2类评测场景(基础任务和应用任务)、4项评测要素(评测方式、评测指标、评测数据、评测工具)以及6种评测维度(功能性、准确性、可靠性、安全性、交互性、应用性)。
评测场景:基础任务主要关注图文结合的各类通用任务场景,应用任务则着重考察模型在特定领域和场景下的泛化能力。
评测要素:
- 评测方式:包括零样本、单样本、少样本以及提示工程等评测方式,以及客观评测和主观评价两种测试结果判断方式。
- 评测指标:分为客观类指标(如准确率、召回率、实时性等)和主观类指标(如图片美观性、逻辑正确性等)。
- 评测数据:需遵循丰富性、公平性和准确性原则,分别面向基础任务和应用任务探索评测数据构造策略。
- 评测工具:“弈衡”大模型评测平台,提供数据与模型管理、评测流程管理、结果分析与展示等功能。
评测维度:
- 功能性:关注任务丰富度、多模态能力和支持完备度。
- 准确性:关注模型执行各类任务的性能,根据任务类型选择合适的评价指标。
- 可靠性:关注抗噪声能力和输出结果的一致性。
- 安全性:考察生成结果的毒害性和公平性,包括歧视偏见、内容毒性、违规违法等。
- 交互性:关注用户使用图文大模型时的交互体验,包括实时性、连续性、丰富性和规范性等。
- 应用性:关注产品或系统在现实应用场景中的部署、运维、支撑能力和使用效果。
未来展望:评测技术的研究重点可能聚焦于针对特定业务场景开展评测和跟踪技术演进优化评测体系。
中国移动“弈衡”评测体系的意义:为中国移动工业、政务、金融、交通、安全等十余个行业大模型的全面客观评测提供标准基线,助力中国移动AI+重塑千行百业;为业界大模型评测提供参考依据,推动国产大模型产业成熟和落地应用。