GPT-6并未采用新架构,但其思维链(COT)表现出更短的长度和更高的信息密度。通过优化RL大幅缩短COT长度,在保持推理能力的同时降低成本,并有助于图像理解等抽象任务。
思维链COT的信息密度高,蒸馏仍可应用,但国内与海外在RL优化上存在较大差距,这限制了国内模型在某些复杂任务上的表现。
近半年预训练多模态数据占比提升至40%,Computer Use能力持续增强。模型尝试驾驭CAD、EDA等专业工具,通过生成可编辑代码文件实现终端展示,已攻克简单结构件设计,但整体设备设计仍需提升,专业工具软件预期需求量将大增。
若以10万卡算力消耗测算,GPT-6可能是5万亿参数规模、200万亿训练数据、3个月训练的模型。这一规模和训练数据量使其在推理能力和多模态任务上具有显著优势。
虽然GPT-6在思维链优化和多模态能力上取得进展,但多模态能力结合效果仍待观察,且国内外RL优化差距可能持续存在,这些因素可能影响模型的实际应用效果。