一、语言模型
语言模型的目标是计算任意词序列的概率,使其能够理解人类语言。早期方法包括One-hot Encoding和Word Embedding,分别通过独热编码和词向量表示词语,使计算机能够理解词语的语义关系。语言模型的技术演化经历了基于统计的N-gram、循环神经网络(RNN、LSTM、GRU)和基于神经网络的Transformer等阶段。
二、Transformer
Transformer模型引入了自注意力机制,支持并行计算和全局上下文理解,并通过多头注意力机制从多个角度捕捉复杂的语义关系。Transformer模型的技术架构包括自注意力机制、多头注意力、前馈网络、位置编码和层归一化等。大型语言模型的简史表明,自监督学习算法(如MLM/NTP/MAE)解决了海量数据标注问题,而预训练时代的大模型(如BERT、GPT)通过大规模数据训练和模型优化,实现了语言生成、世界知识和上下文学习等能力。
三、大型语言模型简史
大型语言模型的简史表明,GPT-3展示了强大的涌现能力,而ChatGPT则标志着人工智能的IPHONE时刻。OpenAI通过代码训练和指令微调增强了GPT-3的能力,而ChatGPT则通过人类反馈的强化学习(RLHF)实现了与人类对齐。多模态模型(如GPT-4v、GPT-4o)则实现了文本、图像和其他模态的连接,而推理模型(如OpenAI-o1/o3、DeepSeek-V3/R1)则实现了从生成到推理的重心转变。
四、DeepSeek
DeepSeek模型并非颠覆性基础理论创新,而是通过系统级协同工程创新,打破了大语言模型以大算力为核心的预期天花板。DeepSeek-V3通过动态路由机制和专家共享机制,实现了高效推理,而DeepSeek-R1则通过基于规则奖励的强化学习和模型蒸馏,进一步提升了推理能力。DeepSeek-R1-Distill模型则通过知识蒸馏,大幅提升了低参数量模型的性能。
五、新一代智能体
新一代智能体是Agent和LLM的结合,其核心能力是逻辑推理。新一代智能体包括规划技能、工具使用、记忆和行动等能力,能够实现时空智能的自主化服务。Deepseek从LLM到Agent的发展,展示了其在多个领域的应用潜力。