GPT-6通过强化学习(RL)优化显著缩短了思维链(COT)长度并提高信息密度,在不改变推理能力的前提下降低了模型成本,并有助于图像理解等抽象任务。这一改进未采用新架构(如Loop transformer),但效果显著。
近半年预训练数据中多模态占比最高达40%,computer use能力持续提升,推动专业工具软件需求大幅增长。模型已能通过生成可编辑代码(如CAD文件)驾驭专业工具,完成简单结构件设计,但整体设备设计能力仍需提升。创意需求将驱动行业变革。
基于10万卡算力消耗测算,GPT-6可能是5万亿参数规模、200万亿训练数据的模型,训练周期约3个月。这一估算为模型能力提供了参考,但具体参数仍需进一步验证。
GPT-O1通过长COT提升推理正确率,Astra在正确率基础上大幅缩减COT长度,实现降本革命。多模态能力结合效果待观察,市场需关注技术落地与商业化进程。
思维链COT的高信息密度仍可支持蒸馏技术,但无法弥补国内外在RL能力上的差距。模型在专业工具软件应用中整体设备设计能力仍需提升,多模态数据占比提升也带来技术整合挑战。