CRASE5 自动评分引擎与 ACT 写作测试信心评分研究
1. 引言
ACT 自 2022 年起开始使用 CRASE® 自动评分引擎对国际版 ACT 写作测试在线作文进行评分,并计划于 2026 年 4 月起在 ACT 写作测试中引入信心评分。信心评分是指当 CRASE 对其评分高度自信时,仅使用自动评分对部分作文进行评分,其余作文则由人工评分。
2. 自动评分与 CRASE5
CRASE 是 ACT 于 2007 年开发的自动评分引擎,已用于多个州级和国家级测试项目。CRASE5 是 CRASE 的最新版本,于 2025 年 9 月起用于 ACT 写作测试作文评分。
3. ACT 写作测试作文评分流程
- 人工评分:最初由两名独立人工评分员对作文进行评分,若评分差异较大则由专家进行第三读,并设有第四读进行质量控制。
- 自动评分-人工评分(AS-HS):自 2022 年 10 月起,ACT 使用 CRASE 替代其中一名人工评分员,并增加了对 CRASE 评分的质量控制。
- 信心评分:CRASE5 为每个作文的四个写作领域(思想与分析、发展与支持、组织、语言使用与规范)提供 0.0 到 1.0 之间的信心分数。若信心分数超过预设阈值,则由 CRASE5 在 2-12 分的量表上重新评分;若未超过阈值,则由人工评分员进行评分。
4. 研究问题、数据和方法
研究问题:
- ACT 信心评分与人工评分的准确性比较。
- ACT 信心评分对 ACT 写作测试原始分数的影响比例。
- ACT 信心评分对 ACT 写作测试量表分数的影响。
数据:使用 ACT 写作测试通用评分模型盲验证样本,包含 5,128 篇作文,涵盖 11 个写作题目。
方法:
- 使用分布统计和一致性指标(包括标准化平均差、标准差比、精确一致性率、邻近一致性率、非邻近一致性率、未加权卡方系数、二次加权卡方系数和皮尔逊相关系数)评估评分准确性。
- 使用双向表格统计不同评分方法下的分数差异。
- 使用描述性统计和图形分析不同量表上的分数(2-12 总写作分数、8-48 总原始分数、1-36 写作量表分数)。
- 使用等百分位等值法分析 ACT 信心评分与人工评分的一致性。
5. 结果
ACT 信心评分准确性:
- 分布统计显示,ACT 信心评分的均值、标准差和分数点分布与人工评分相似。
- 一致性指标表明,ACT 信心评分与人工评分高度一致:
- 标准化平均差小于 0.10。
- 标准差比接近 1.0。
- 精确一致性率超过 60.0%。
- 非邻近一致性率在三个领域低于 5.0%,第四领域略高于 5.0%。
- 二次加权卡方系数超过 0.90。
ACT 信心评分对单个作文分数的影响:
- 在四个领域内,约 95% 的作文的 CRASE5 评分与人工评分相差不超过 1 分,几乎所有作文相差不超过 2 分。
- 约 60% 的作文的 CRASE5 评分与人工评分相同。
ACT 信心评分对总分数和量表分数的影响:
- 总写作分数(2-12 分)和总原始分数(8-48 分)的分布与人工评分相似。
- 写作量表分数(1-36 分)的分布与人工评分相似。
- 等百分位等值法显示,ACT 信心评分与人工评分在 2-12 总写作量表和 1-36 写作量表上高度一致。
6. 结论
ACT 信心评分在大多数情况下能够产生与人工评分相当的分数。建议在使用 ACT 信心评分时实施充分的质量控制方法,以确保为考生提供最准确、最可靠的 ACT 写作测试分数。