研究总结
该研究探讨了使用ChatGPT生成社会情感学习(SEL)评估项目的可行性与效果,并与人类专家生成的评估项目进行了比较。
研究方法与阶段
研究分为四个阶段:
- 项目生成:让ChatGPT和两位人类项目撰写人分别生成李克特量表(Likert)项和强制选择(FC)项,涵盖责任心、宜人性、情绪稳定性三个领域。
- 初步观察和分析:发现ChatGPT生成的项目存在反向计分项、双关项、多维度项,且项目长度和认知负荷显著高于人类生成项。
- 主题专家评分:四位SEL领域专家对项目进行评分,结果显示人类生成的李克特项和FC项在指标有效性上优于ChatGPT生成项,但在语言自然度上无显著差异。
- 学生调查:邀请1707名ACT考生完成人类或ChatGPT生成的评估,并进行可靠性(Cronbach's alpha)和有效性(结构效度、效标关联效度)分析。
关键数据与结果
- 项目特征:
- ChatGPT生成的李克特项平均长度12.6个单词,Flesch-Kincaid阅读等级10.1;人类生成项平均长度7.6个单词,Flesch-Kincaid阅读等级4.1。
- 人类生成的FC项平均长度6.4个单词,Flesch-Kincaid阅读等级4.7;ChatGPT生成项平均长度14.8个单词,Flesch-Kincaid阅读等级13.2。
- 专家评分:
- 李克特项:人类(M=5.28)与ChatGPT(M=5.40)无显著差异(t=-0.62, p=0.54)。
- FC项:人类(M=5.47)显著优于ChatGPT(M=3.97)(t=3.86, p<0.01)。
- 可靠性:
- Likert项:人类和ChatGPT的Cronbach's alpha均超过0.70。
- FC项:ChatGPT删除问题项目后的可靠性(α=0.79-0.72)高于人类(α=0.63-0.63)。
- 有效性:
- 结构效度:ChatGPT生成的评估拟合度略好(CFI=0.90 vs 0.86),但因子间相关性更高(0.47 vs 0.39)。
- 效标关联效度:
- ChatGPT在尽责性(挑战自我)、宜人性(人际相处、尊重他人)上表现更强。
- 人类在情绪稳定性(与紧张天数相关性)和尽责性(挑战自我)上表现更强。
研究结论
- ChatGPT在生成SEL评估项目时存在缺陷,如反向计分项、双关项、多维度项,且项目复杂度较高。
- 尽管ChatGPT生成的评估在内部一致性可靠性(尤其FC项)上表现较好,但在指标有效性和语言自然度上不及人类生成项。
- ChatGPT可作为辅助工具用于项目生成,但需谨慎使用并优化提示词,避免完全依赖其生成评估项目。
- 研究强调需核实ChatGPT生成内容的重要性,因其可能存在错误(如数学问题准确率从98%降至2%)。