背景与动机
当前的评测指标缺少针对多模态STEM科目和社会规范基础能力的数据集。STEM能力是解决现实问题的基础,但现有评测数据集往往只关注专家级别能力,缺乏针对STEM科目的多模态数据集。同时,可信可靠的AI系统应遵循社会规范,但现有评测数据集常只关注高阶人类价值观,缺少评测模型对社会规范形成过程中基础能力的掌握。
解决方案
提出两个大规模数据集:
- STEM数据集:评估模型的基础STEM科目能力。
- 包含1,073,146道选择题,涵盖K-12教育的448个技能知识点。
- 数据来源于三个习题网站,通过程序爬取与人工检查筛选。
- 按照6:2:2的比例分为训练集、验证集、测试集。
- Social数据集:评估模型对基础社会规范的掌握。
- 包含12,383道选择题,涵盖K-12难度的402个技能知识点。
- 评测近期的LLMs(如LLaMA-2和GPT-3.5-Turbo),提出SocialAgent方案增强模型推理能力。
多模态STEM能力评测
- 评测方法:使用在线习题网站评测模型的测验分数,与人类水平比较。
- 主要实验结果:
- 模型表现弱于人类学生平均水平,测验分数和准确率均低于人类。
- 问题变长、选项数量变多、样例数量变少时,模型表现下降。
- 模型测验分数随题目年级升高而降低。
- 实验分析:
- 困难的技能点涉及抽象知识和复杂推理。
- 错误类型分析显示模型在视觉感知和推理能力上存在不足。
- 校准性分析表明微调过的模型具有更好的校准性。
语言与社会规范评测
- 预实验:大语言模型表现明显提升但仍落后于人类。
- Agent设计:
- 采用多智能体交互方案,通过智能体间交流增强模型能力。
- 结合知识抽取、形式计算和推理知识,提升模型对社会规范的理解。
- 主要实验结果:
- SocialAgent方案使大模型表现接近人类水平。
- 细粒度分数分析显示模型在推理和知识利用上有所提升。
总结与展望
- 核心观点:
- STEM数据集和Social数据集为评测模型的基础STEM能力和社会规范理解能力提供了大规模基准。
- 大模型在基础科目上仍落后于人类,需增强推理能力和知识利用能力。
- 关键数据:
- STEM数据集:1,073,146道题目,448个技能知识点。
- Social数据集:12,383道题目,402个技能知识点。
- 研究结论:
- 通过细粒度数据分析,可针对性地改进模型。
- 未来工作包括评测更新的大模型和多模态基础模型表现,并进一步增强模型推理和知识利用能力。
- MMEvalPro评测方案:
- 通过三阶段评估流程和更严谨的评价指标校准LMM评估过程。
- 实验表明MMEvalPro更具挑战性,当前最佳LMM模型性能与人类性能差距仍较大。
- 大模型时代的评测:
- 评测的有效性需关注数据泄露、标签准确性、数据代表性等问题。
- 评测的启发性需分析模型对错原因、知识获取和能力短板。