核心观点与发现
- 生成式AI在行为研究中的应用潜力:该研报探讨了大型语言模型(LLMs)如OpenAI的GPT是否可以创建“合成”研究参与者,以模拟人类在调查中的反应,并评估其在政策研究中的潜力。
- 研究范围与对象:研究考察了沙特阿拉伯、阿联酋和美国三个国家在可持续发展、金融素养和女性劳动力参与率三个政策领域的合成参与者与人类参与者的相似度。
- 主要发现:
- 相关性:合成参与者在三个政策领域均与人类参与者表现出强相关性,但美国样本的相关性最高(r = 0.86),其次是阿联酋(r = 0.75)和沙特阿拉伯(r = 0.65)。
- 精确度:合成参与者的回答方向与人类参与者一致,但在精确度上仍有提升空间,无法精确匹配人类参与者的平均回答值。
- 偏差:GPT在美国样本中表现出正向偏差(高估人类对政策的支持),而在沙特阿拉伯和阿联酋样本中表现出负向偏差(低估人类对政策的支持)。
- 行为实验:GPT能够预测干预措施对自我报告行为的影响程度,但无法始终准确预测干预措施是否具有统计学上的显著性。
研究结论与政策建议
- 初步测试与高级阶段:建议在政策开发和测试的初步阶段使用GPT合成参与者进行观点测试和干预措施试点,但在更高级的阶段使用人类参与者以获得更精确的结果。
- 关注偏差:在使用合成参与者进行政策研究时,需注意潜在的偏差,并根据不同地区进行调整。
- 简化提示策略:使用简单的提示策略(如提供基本人口统计特征)创建合成参与者,可以获得与更复杂提示策略相当甚至更准确的结果。
- 区域化模型开发:建议开发基于MENA地区数据的LLMs,以减少偏差并更好地反映该地区的政策挑战。
未来研究方向
- 探索更多领域和背景下的偏差:进一步研究GPT在其他政策领域和背景下的偏差,并分析其根源。
- 基于区域数据的模型训练:开发基于MENA地区数据的LLMs,以更好地支持该地区的政策研究。