您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:一些探讨1训练进程尚未完结然而模型范式已经趋于统一 - 发现报告

一些探讨1训练进程尚未完结然而模型范式已经趋于统一

2025-02-18 未知机构 丁叮叮叮
报告封面

1.训练进程尚未完结,然而模型范式已经趋于统一。 xAI此次完全凭借超大集群,在极短时间内实现了对之前最优模型(sota)的超越,这一事实充分说明,在当下的发展阶段,算力的竞争才是最为核心的要素。 2.平心而论,经过深入思考,利用10万至20万张卡组成的集群,最终仅达成了比之前最优模型(sota)高出20%到30%的提升效果。 一些探讨 1.训练进程尚未完结,然而模型范式已经趋于统一。 xAI此次完全凭借超大集群,在极短时间内实现了对之前最优模型(sota)的超越,这一事实充分说明,在当下的发展阶段,算力的竞争才是最为核心的要素。 2.平心而论,经过深入思考,利用10万至20万张卡组成的集群,最终仅达成了比之前最优模型(sota)高出20%到30%的提升效果。 这一情况清晰地显示,预训练(pre – train)所带来的收益实际上并不显著,相比较而言,将资源更多地投入到强化学习(RL)领域,可能会获得更高的性价比。 但不可忽视的是,以基础模型与强化学习双轮驱动,甚至实现两者相互促进、协同发展,这已经成为行业内的普遍共识。 因此,基础模型的研发工作依旧不能松懈,必须持续深入地开展下去。 3.对于这10万张卡或者20万张卡中,实际用于训练的卡数量,并没有确切的信息披露。 但可以明确的是,构建这样一个规模庞大的集群,花费了214天的时间,而其中训练过程可能占用了90天。 如此一来,所耗费的成本已经达到了几亿美金。 在这种情况下,将其成果与deepseek V3进行对比,难免会让人觉得有失公允……毕竟是以50倍的成本投入,才仅仅实现了30%的超越…… 4.合此次事件,再结合近期围绕r1推理成本展开的讨论,能够清晰地认识到,在当前的技术发展阶段,无论是模型训练环节,还是推理应用环节,大规模的集群支持依旧是必不可少的要素。