总结
本文探讨了大型语言模型(LLMs)在一般任务上的表现,特别是针对追求通用人工智能(AGI)的LLMs。作者通过让最新的LLM代理玩《纽约时报》的三款游戏(Wordle、Face Quiz和Flashback)来评估它们的能力。
核心观点:
- 现有的LLMs在狭窄的任务中表现出色,但在需要自我意识和高级认知能力的一般任务中表现不佳。
- LLMs缺乏从错误中学习的意识以及自我修正的能力,无法识别自己的错误并采取相应行动。
- 追求AGI的LLMs需要具备整合众多认知子任务的能力,以成功地解决完整任务。
关键数据和研究结论:
- Claude CU在Wordle游戏中,正确解答了63个中的34个,但在某些情况下会错误地宣布自己已经赢得游戏。
- Claude CU在Face Quiz游戏中,正确识别了52人中的37人,但在一些情况下需要提示才能完成。
- Claude CU在Flashback游戏中,能够导航到游戏、阅读说明并开始玩,但在某些情况下会犯错误,例如未能识别新的信息或错误地放置事件。
- OpenAI的GPT o1在Wordle游戏中表现出色,但偶尔会错误地读取字母的颜色。
- OpenAI的Operator在Wordle游戏中,能够识别自己输入了错误的字母,但在某些情况下会反复犯错。
- OpenAI的Operator在填写Google表格时,展示了熟练程度,但也会输入错误的字母。
研究结论:
- 追求AGI的LLMs需要通过广泛的、综合的实验进行评估,涵盖多个认知任务,使它们能够解决完整、现实世界中的应用。
- LLMs在成为自我改进之前,必须首先发展自我评估、自我批评和自动纠错的能力。
- 人类监管在LLMs的应用中仍然是必要的,尤其是在它们被用作代理的情况下。
两种情景:
- 协驾驶系统:AGI-aspiring LLMs作为中央银行内部工具,协助人类专家完成日常任务,提高效率。
- 代理商:AGI-aspiring LLMs作为代理人,可以直接利用计算机,在特定、明确的任务中用最小的人类监管取代人类。
总体而言,本文强调了在评估追求AGI的LLMs时进行全面实验的必要性,并指出LLMs在一般任务上的表现仍有待提高。