AGI定义:四类锚点与底层分歧
通用人工智能(AGI)的核心研究问题在于如何定义、衡量并判断其到来。全球机构对AGI的理解主要分为四类:
- 经济价值口径(如OpenAI、麦肯锡):关注AI替代经济价值工作的能力。
- 能力分级口径(如DeepMind):从性能和通用性二维刻画能力层级(L0-L5)。
- 技能获取效率口径(如Chollet/ARC):强调在陌生任务上快速学会的能力。
- 世界理解与具身交互口径(如LeCun、李飞飞):强调缺乏世界模型和具身交互的系统不算真正通用。
不同定义反映了对智能衡量标准的分歧,从结果、能力、学习效率到世界模型的不同侧重。
全球机构判断:AGI是一条能力阶梯而非单一时点
主要AI机构对AGI的判断分为四类:
- 激进(近端):如OpenAI,认为AGI是逐步实现的能力阶梯,当前处于L2向L3过渡。
- 审慎(远端):如DeepMind,认为AGI需在性能和通用性上达到较高水平(如L3专家级通用AI)。
- 务实(应用):如多数中国大厂,重应用落地,对时间表保持克制。
- 具身(物理):如中国具身企业、LeCun,主张智能须在物理世界习得。
通往AGI:现有范式能否外推仍未收敛
各机构已公开的分级框架
- OpenAI五级路线图:以经济价值和自主程度为主轴,从对话者到组织级AI。
- DeepMind L0-L5分级体系:以性能和通用性二维刻画,L0为无AI,L5为超人级AGI。
主要技术路径
技术路径尚无统一分类,包括:
- 大模型规模化
- 测试时推理
- 强化学习
- 智能体系统
- 物理具身
三大分歧的根源
- 激进/近端:认为现有范式可外推,规模化和推理可推进至AGI。
- 审慎/远端:认为现有模型缺世界模型和因果,需新范式或物理具身。
- 务实阵营:重应用落地,对时间表保持克制。
- 具身阵营:主张智能须在物理世界习得。
时间表预测的方法与口径
乐观者预期2030年左右,AI从业者预期中位数2047年。
AGI衡量:新基准涌现,统一标准仍缺位
衡量AGI的主要困难
- 基准饱和:数学、代码、知识问答类基准已难区分高下。
- Goodhart定律:指标一旦成为优化目标就不再是好指标。
- 数据污染:训练数据可能含测试题,污染检测缺乏统一标准。
- 依赖自报:常依赖厂商自行公布的成绩。
主流评测基准
- 行业标准套装:SWE-bench、ARC-AGI-2、GPQA、HLE、GDPval等。
- ARC-AGI:被多家大厂写入模型卡,但前沿成绩快速提升。
各方提出的替代标尺
- 经济价值(GDPval)
- 泛化效率(ARC-AGI)
- 自主任务时长(METR)
- 能力分级(DeepMind L0-L5)
- 对抗/动态评测
经济影响:测算口径决定价值判断
主要测算方法
- 用例增加值法:生成式AI每年可新增2.6-4.4万亿美元增加值。
- 职业/任务暴露法:约80%美国劳动力任务被AI影响。
- 宏观task-based法:未来十年AI对GDP拉动约1%。
- 行业咨询综合法:到2030年AI可为全球经济贡献约15.7万亿美元。
- 全自动化→增长爆发:AGI全自动化可能带来远超历史增速的年增长。
差异的根源
- 测对象不同:现有AI渐进影响 vs AGI跃变影响。
- 关键假设不同:自动化广度、瓶颈、再配置速度。
风险治理:审慎派与加速派并存
审慎/风险派
- 代表:Hinton、Bengio、Stuart Russell。
- 主张:立即监管、国际合作、安全设计。
- 已采取措施:成立组织、推动政策、开源。
淡化/加速派
- 代表:LeCun、吴恩达、Marc Andreessen。
- 主张:开源、反对过度监管。
- 已采取措施:推动开源、游说反对限制性监管。
中间/务实派
- 主张“人本超级智能、可控不自主”。
- 多数政府走“分级—透明—评测”路线。
风险提示
- 技术迭代不及预期
- 大模型厂商ARR增速放缓
- 云服务商资本开支不及预期
- 智能驾驶及机器人商业化落地不及预期