总结
本文探讨了通用人工智能(AGI)追求型大型语言模型(LLMs)在一般任务上的表现,特别是其在解决复杂任务中的认知能力。作者通过让LLM代理玩纽约时报的三款游戏(Wordle、Face Quiz和Flashback)来评估其能力,发现LLMs在认知子任务上表现出混合的绩效,缺乏从错误中学习的能力和自我纠正的容量。
核心观点
- LLMs的评估方法:当前对LLMs的评估通常包括具有明确度量的单维度明确问题,这些测试虽然能评估LLMs的熟练程度,但并不能反映其在现实世界环境中的表现。
- LLMs的认知能力:本文通过让LLMs玩Wordle、Face Quiz和Flashback游戏,发现它们在识别答案错误、学习和实践有效决策方面存在缺陷,缺乏自我意识和自我纠正的能力。
- LLMs的局限性:LLMs在认知子任务上的表现,如识别错误、调整方法、处理信息等,仍不如人类,尤其是在面对动态环境和模糊性时。
关键数据和研究结论
- 实验结果:Claude CU在Wordle游戏中,正确解决了63个案例中的34个,但在一些案例中错误地宣布自己已经获胜。在Face Quiz中,Claude正确识别出了52人中的37人。在Flashback中,Claude在时间线的理解和事件放置上表现出色,但在适应错误方面存在不足。
- LLMs的应用场景:作者提出了两种场景来探讨LLMs在中央银行中的应用:
- 作为辅助系统:LLMs可以协助人类专家完成日常工作,如数据分析、验证交易、报告生成和编码等,但需要人类提供输入和调整输出。
- 作为代理:LLMs可以自主执行任务,但目前仍需要“人在回路”来解释结果和做出高级决策。
总结
本文认为,追求AGI的LLMs需要通过涵盖多个认知任务的一般任务来评估,使其能够解决完整、真实世界的应用。LLMs在当前阶段仍处于beta阶段,需要进一步发展和改进,才能在现实世界中发挥更大的作用。