本文实证评估了当前大型语言模型(LLM)分析IMF Article IV工作人员报告中宏观金融问题的能力,以人类经济学家的评估作为基准。
核心观点:
- 某些GPT模型在分析IMF工作人员报告中宏观金融问题方面表现出有用但有限的准确性,尤其是在结构化、基于事实的问题上。
- 最新模型在2024年对评级问题的平均准确率为71-75%,对二元问题的平均精确匹配率为76-81%。
- LLM倾向于比人类专家分配更高的、更集中的评级,并且在需要深度上下文判断的开放式问题上表现不佳。
关键数据:
- GPT-o1、GPT-4.1和GPT-5等高级模型在评级问题上的准确率高于GPT-4o。
- 二元问题的精确匹配率在2024年达到80.6%(GPT-o1)和76.3%(GPT-4.1)。
- LLM在重复测试中表现出高度的一致性,二元问题的平均匹配率为88%,评级问题的平均准确率为83%。
研究结论:
- LLM可能能够复制部分手动审查过程,为宏观金融分析提供效率提升。
- LLM的乐观倾向可能导致对报告质量的误判,需要人类监督。
- LLM在事实性、二元问题上表现较好,但在开放式问题和深度推理方面存在局限。
- 未来研究可探索改进提示设计、上下文基准测试和扩展数据样本,以提升LLM的分析能力。
- LLM可作为人类审查者的辅助工具,而非替代品,通过人机协作提高效率和一致性。