大模型技术的持续进化正在重塑机器智能的定义,引发深层次变革。大模型正逐步拥抱多模态数据,实现感知与认知能力的全面升级,并朝着模拟与适应真实物理世界的方向发展。具身智能的加速落地,进一步塑造了机器的物理形态。
大模型技术趋势主要包括:
- 科学的未来:AI4S驱动科学研究范式变革。大模型在科学研究中的应用,展现出与传统人工智能不同的赋能效果,能够进行整体理解与全局综合分析,并提出创新性假设。例如,俄亥俄州立大学的LlaSMol大模型在化学任务上取得优异成绩,DeepMind和Isomor-phicLabs发布的AlphaFold3能够准确预测蛋白质与其他分子的相互作用。预计未来,多模态大模型将进一步融入科学研究,为生物医学、气象、材料发现等基础与应用科学的研究开辟新方向。
- “具身智能元年”:具身大小脑和本体的协同进化。2024年,全球范围内的具身智能竞争日渐白热化,中国在该领域处于领先地位。具身智能行业由专注本体/零部件、具身脑、具身脑和本体并重等三类厂商主导。大模型目前在具身大脑应用较多,本体方面则在组分领域有所创新。具身大模型的技术路线主要有端到端模型和分层决策模型。预计2025年,具身智能将继续从本体扩展到具身脑,行业格局将迎来洗牌,技术路线将有所突破,商业变现也将更加丰富。
- “下一个Token预测”:统一的多模态大模型实现更高效AI。当前的多模态大模型存在天然的局限性,而统一的多模态大模型能够打通多模态数据,实现端到端输入和输出的原生多模态技术路线,为多模态大模型进化提供了新可能。例如,OpenAI发布的GPT-4o和Google发布的Gemini2.0都是原生多模态大模型。预计未来,原生多模态大模型将进一步发展,性能泛化也将得到提升。
- ScalingLaw扩展:RL+LLMs,模型泛化从预训练向后训练、推理迁移。随着预训练ScalingLaw亚线性幂律关系的存在,通过预训练实现模型性能提升的门槛不断提高。OpenAI发布的o1和o3等模型,通过利用强化学习在训练和推理时的规模定律,提高找到最佳推理路径的可能性和效果。预计未来,ScalingLaw将扩展到后训练、推理等其他阶段,强化学习也将在其中发挥重要作用。
- 世界模型加速发布,有望成为多模态大模型的下一阶段。世界模型通过构建对外部世界的模拟,赋予AI更高级别的认知、适应和决策能力。例如,Google发布的Genie2、Meta推出的导航世界模型NWM等。预计未来,世界模型技术路线的竞争将持续,性能泛化程度将出现分野。
- 合成数据将成为大模型迭代与应用落地的重要催化剂。高质量数据将成为大模型进一步Scalingup的发展阻碍,合成数据已经成为基础模型商补充数据的首选。例如,微软发布的Phi-4使用了不少于50个合成数据集来训练,智源研究院推出的Infinity-Instruct数据集50%以上均为合成数据。预计未来,合成数据在模型训练的占比将持续提高,成为大模型性能迭代与应用落地的重要催化剂。
- 推理优化迭代加速,成为AINative应用落地的必要条件。大模型的应用外延持续扩展,但推理优化技术日益成为产研侧关注重点。例如,Meta与麻省理工团队通过对模型层的智能化裁剪,显著节省内存消耗;微软推出的BitNet架构使用“BitLinear”层替代标准线性层,显著节省内存消耗。预计未来,国内外厂商将围绕长文本、复杂交互、边缘部署等应用场景,持续推动推理优化技术迭代。
- 重塑产品应用形态,AgenticAl成为产品落地的重要模式。更通用、更自主的智能体将重塑产品应用形态,进一步深入工作与生活场景。例如,OpenAI发布的ComputerUse、智谱AI推出的AutoGLM升级版等。预计未来,更多智能化程度更高、对业务流程理解更深的智能体系统将在应用侧落地。
- AI应用热度渐起,SuperApp花落谁家犹未可知。近年来,生成式模型在图像、视频侧的处理能力得到大幅提升,叠加推理优化带来的降本,AI超级应用的可能形态或已初现端倪。例如,苹果发布的AppleIntelligence、字节跳动的人工智能应用豆包等。预计未来,AI应用热度将持续攀升,AI超级应用将应运而生。
- 模型能力提升与风险预防并重,AI安全治理体系持续完善。大模型的Scaling带来了涌现,但也带来了潜在的安全风险。例如,OpenAI公布了公司正在实施的10大AI安全措施,Google发布了SAIF安全AI框架,蚂蚁集团自研了大模型安全一体化解决方案“蚁天鉴”等。预计未来,将构建起与智能水平相匹配、合乎伦理、可靠、可控和尊重知识产权的AI安全治理体系。