AGI的核心能力与现状分析
AGI的定义与核心能力
AGI(通用人工智能)是指在任何人类专业领域内具备相当于人类智慧水平的AI,能够执行任何人类可以完成的智力任务。AGI需具备四大核心能力:
- 语言能力:使用自然语言交流
- 知识储备:包含常识知识和专业知识
- 推理能力:包括演绎、归纳和溯因推理
- 学习能力:根据历史数据进行自我学习
其中,推理能力被视为AGI的核心,包含:
- 演绎推理:从一般前提推导具体结论(如三段论)
- 归纳推理:基于有限观察归纳规律(如“有翅膀的动物都是鸟”)
- 溯因推理:从事实推导最佳解释(如“车漏油导致无法启动”)
推理能力的现状评估
-
演绎推理
- 优势:有较好的数学工具支持,大模型表现较好
- 问题:
- 2023年5月版本仍无法解决复杂逻辑题
- 强化学习虽能优化分步推理,但仍是独立任务优化
- 大模型在分布外数据集(OOD)处理能力不足
- ChatGPT/GPT-4在逻辑推理基准测试中表现优异,但在OOD数据集上困难
- 真实应用案例:
- 研究表明大模型可能依赖预训练阶段学习的事实捷径(如将“日本举办奥运会”改为“法国”后仍错误判断)
- 论文《Investigating Multi-Hop Factual Shortcuts in Knowledge Editing of Large Language Models》证实此现象
-
归纳推理
- 能力局限:
- 数学计算任务中,GPT3在复杂度增加时准确率接近0
- 超过1.8M乘法对时模型失效,即使进行针对性微调也无效
- 简单训练过程干预对提升归纳能力作用有限
- 评测数据:
- 论文《Faith and fate: Limits of transformers on compositionality》显示,GPT3在1≤k1,k2≤4且k1·k2≤9的乘法任务中表现良好,但在OOD数据集上表现差
- 论文《How well do Large Language Models perform in Arithmetic tasks?》进一步验证
知识运用能力评估
大模型在四项知识任务中表现如下:
- 检索:表现较好
- 分类:表现一般
- 比较:难以完成
- 逆向搜索:无法完成除非知识以逆序出现在预训练数据中
相关研究来自《Physics of Language Models: Part3.2, Knowledge Manipulation》
结论
- 推理能力是AGI发展的关键瓶颈,尤其是归纳推理能力严重不足
- 现阶段大模型在演绎推理中仍依赖捷径而非真正的逻辑推理
- 知识运用能力存在明显短板,难以完成比较、分类和逆向搜索任务
- 当前大模型具备长上下文建模、语义表示、多任务学习和跨语言迁移等优势
- 若要实现AGI,必须突破推理能力的限制