OpenAI发布的新模型系列o1(代号“草莓”)在科学、数学、代码等类问题的表现上比之前的模型更好,其特点是在给出推理结果前,花更多时间“思考”,产生较长内部思维链。o1的API定价昂贵,且使用次数限制较大:o1-preview每百万token输入15美元,每百万输出token60美元;o1-mini每百万token输入3美元,每百万token输出12美元。目前只对已经付过1000美刀的等级5开发者开放,每分钟限制20次。
o1或为OpenAI新模型猎户座(Orion)生成合成数据。合成数据是一种模仿真实世界数据的非人工创建的数据,具有性价比可能更高、更完整、全面、隐私性更好等优点,但也存在可能为模型引入噪声、泛化能力不足等问题。合成数据的不足可以通过诱导幻觉、加入数据评估机制、在训练过程中积累数据等方式尝试解决。
“合成数据+强化学习”,o1或确认大模型进化新范式。o1使用了强化学习(RL)做思维链(Chain of Thought)来训练模型,思维链可以使模型在推理阶段实现能力增强,即Scaling Law可以不止出现在训练阶段,也出现在推理阶段。RLAIF(基于AI反馈的强化学习)逐渐成为当前大模型的热门选择,相较于RLHF(基于人类反馈的强化学习),需要的人类标注较少,适合代码、数学等有客观评价标准的领域。Meta Llama 3、英伟达Nemotron-4 340B、微软Orca-3等热门大模型都使用了合成数据和RLAIF。
根据OpenAI,o1模型训练和测试阶段在美国奥林匹克数学竞赛(AIME)的表现随着训练和测试计算量的增长而变得更好,这表明o1“推理时,在响应用户前,思考更多”有助于让o1表现更好,这正是推理Scaling Law。这有助于打破投资界过往的担忧,即“推理需要的算力比训练少,当大模型的进化转向推理,算力板块承压”;相反,推理Scaling Law仍然利好算力板块。
建议关注光模块产业链、液冷服务商、PCB服务商、AIDC等领域的投资机会。
风险提示:大模型算法进展不及预期,大模型应用落地不及预期,全球宏观经济下行风险。