核心观点与关键数据
OpenAI于12月7日发布了强化微调(Reinforcement Fine-Tuning)技术,这是一种模型定制技术,通过强化学习帮助开发人员和研究人员创建在特定领域完成任务的专家模型。该技术迭代更新了去年的监督微调技术,不仅模仿输入,更能教会模型在自定义领域中进行推理,强化正确答案的思维路径。
技术测试与表现
在罕见遗传病的预测测试中,研究人员向o1-mini提供了一份约1100个示例的数据集,并输入指令(输出可能导致该遗传病的基因及原因),同时提供正确答案进行评分。结果显示,经过强化微调的o1-mini在推理遗传病基因任务的top@1指标上准确率达到31%,超出初始o1-mini的17%和o1的25%,在top@5、top@max指标上同样表现优异。
研究计划与领域应用
强化微调技术将于明年正式推出,OpenAI正在扩展强化微调研究计划,邀请研究机构、大学和企业参与,特别鼓励法律、保险、医疗保健、金融和工程等领域的企业申请。该技术擅长处理结果为大多数专家所认同的客观“正确”的任务。
投资建议
随着强化微调的进一步推进与应用,AI技术的深度整合预计将带动部分科技公司的长期增长。建议关注谷歌(GOOGL.0)和微软(MSFT.0)等科技巨头在AI及云计算领域的领先地位。
风险提示
需注意宏观经济波动导致市场需求不足、未来AI研发进展不及预期、端侧AI产品销售业绩不及预期等风险。