过去大语言模型存在数据利用、推理能力和Scaling Law边际收益递减三个方面的局限性,导致发展速度放缓。具体表现为:
- 数据利用层面:现有模型依赖大量预训练数据,但主要学习数据相关性而非因果关系,限制了探索新知识和复杂任务的能力。例如,GPT-4在处理复杂数学问题时表现不佳。
- 推理能力层面:模型在复杂推理任务(如数学解题、代码生成、AI Agent应用)中表现有限,难以进行长时间、多步骤的决策和推理。
- Scaling Law边际收益递减:随着模型规模扩大,性能提升与参数量、数据量和训练时间的增长不成正比,成本收益失衡。GPT-4到GPT-5的性能提升未与参数量增长成正比。
为突破这些局限,OpenAI可能采用自我对弈强化学习(Self-Play)技术,其核心原理是从相关性学习进化到因果性学习,通过模拟和评估逐步推理、进化学习。具体优势包括:
- 提升推理能力:通过蒙特卡洛树搜索模拟不同可能性,逐步拆解决策步骤,实现逻辑严谨的推理。
- 创造高质量训练数据:通过模拟创造大量高质量训练数据,弥补现实数据稀缺问题。
然而,Self-Play也存在局限性:
- 依赖明确评判标准:适用于编程、数学等具有明确反馈的领域,不适用于文学创意、医药研发等评判标准不明确或反馈周期长的领域。
- 推理消耗算力较高:每次推理需多次模拟,导致token消耗大,订阅成本可能较高。
尽管如此,Self-Play仍有望带来新的Scaling Law增长机会:
- 训练端:通过模拟创造高质量数据,提升训练效果。
- 推理端:通过逐步推理和模拟增加推理计算量,提升性能。
新模型推理成本较高,但面向代码生成、AI Agent等高价值应用场景,未来可通过调整参数平衡成本与效益。
东吴传媒观点认为,OpenAI模型更新有望成为AI板块重要催化,打破发展瓶颈,提升算力需求能见度,板块目前处于过度悲观位置,建议关注模型发布及后续GPT-5发布带来的超跌反弹机会。推荐标的包括昆仑万维、焦点科技等模型和应用环节,以及中际旭创、天孚通信等算力环节。