一、语言模型
语言模型的目标是计算任意词序列的概率,使其能够理解人类语言。早期语言模型使用One-hot Encoding和Word Embedding进行编码,但存在缺点。基于统计的N-gram模型通过分析词序列的统计关系进行预测,但无法捕捉长距离依赖关系。基于神经网络的LSTM/GRU模型能够处理序列数据,但存在梯度消失等问题。
二、Transformer
Transformer模型引入了自注意力机制,能够并行计算并理解全局上下文,通过多头注意力机制从多个角度捕捉复杂的语义关系。Transformer模型的技术架构包括自注意力机制、多头注意力、前馈网络、位置编码和层归一化等。大型语言模型的发展历程包括预训练时代(BERT、GPT)和指令微调时代(ChatGPT)。
三、大型语言模型简史
大型语言模型的简史包括:
- 预训练时代:BERT和GPT系列模型通过自监督学习算法(MLM、NTP、MAE)解决海量数据标注问题。
- 指令微调时代:ChatGPT通过人类反馈的强化学习(RLHF)进行指令微调,实现与人类对齐。
- 多模态模型:GPT-4v和GPT-4o实现了文本、图像等多模态输入输出,增强了交互能力。
- 推理模型:OpenAI-o1/o3和DeepSeek-V3/R1等模型在推理能力上取得重大突破。
四、DeepSeek
DeepSeek模型通过系统级协同工程创新,打破了大语言模型以大算力为核心的预期天花板。DeepSeek的技术包括:
- 动态路由机制和专家共享机制:DeepSeek-V3 Base模型参数量达6710亿,但每次token仅激活8个专家,370亿参数。
- 基于规则奖励的强化学习:DeepSeek-R1 Zero使用GRPO进行强化学习,提升模型的推理性能。
- 知识蒸馏:DeepSeek-R1-Distill模型通过知识蒸馏技术,大幅提升低参数量模型的性能。
五、新一代智能体
新一代智能体由Agent和LLM组成,LLM作为大脑,核心能力是逻辑推理。新一代智能体的发展包括:
- LLM开发工具:LangChain和LlamaIndex等工具支持大模型开发。
- 垂类LLM:Code Llama、MathGLM、LawBench等模型在特定领域具有优势。
- 基于LLM的Agent:HuggingGPT、AutoGPT、JARVIS等Agent能够自主完成任务。
- Agent开发平台:GPTs、Coze、Agent Builder等平台支持Agent开发。
六、DeepSeek带来的全栈影响
DeepSeek模型在基础模型层、中间层和应用层都带来了影响:
- 基础模型层:DeepSeek模型在开源和闭源模型中都具有竞争力。
- 中间层:DeepSeek模型提供了大模型开发工具和框架。
- 应用层:DeepSeek模型支持大模型应用开发,包括智能客服、数据经营分析等。
七、新一代智能体的构建
新一代智能体通过LLM和Agent的结合,实现时空智能的自主化服务。例如,时空型GPT作为决策大脑,驱动多智能体协同系统实现流程自组织、任务自执行、内容自生成。