大型语言模型技术演进与应用
一、语言模型发展历程
- 语言模型目标: 计算词序列的概率,让计算机理解人类语言。
- 编码方式: 从 one-hot 编码发展到 word embedding,用低维向量表示词,捕捉词义和上下文关系。
- 技术演化: 从基于统计的 N-gram 模型,发展到循环神经网络(RNN、LSTM、GRU),再到基于神经网络的 Transformer 模型。
二、Transformer 模型
- 核心创新: 自注意力机制、多头注意力、前馈网络、位置编码、层归一化,支持并行计算和全局上下文理解。
- Transformer 模型发展: 从 GPT 到 BERT,再到 GPT-3,模型参数量不断增大,涌现能力增强。
三、大型语言模型简史
- 预训练时代: 大力出奇迹,BERT 和 GPT 系列模型通过自监督学习解决海量数据标注问题。
- GPT 系列模型: 从 GPT-1 到 GPT-3,参数量从 1.17 亿增长到 1750 亿,上下文窗口大小从 1024 增加到 2048。
- ChatGPT: 基于 GPT-3.5,通过人类反馈强化学习(RLHF)进行训练和微调,实现与人类对齐。
- 多模态模型: GPT-4v 和 GPT-4o 支持 text、image、audio 等多模态输入输出,交互能力增强。
- 推理模型: OpenAI-o1/o3 和 DeepSeek-V3/R1 等模型注重推理能力,通过强化学习和知识蒸馏提升模型逻辑推理能力。
四、DeepSeek 模型
- 技术路线: 基于 Transformer 模型,通过系统级协同工程创新,提升模型训练和推理效率。
- DeepSeek-V3: 6710 亿参数,每次 token 仅激活 8 个专家,370 亿参数,混合专家模型和极致工程优化。
- DeepSeek-R1: 通过强化学习和知识蒸馏提升推理能力,基于规则奖励的强化学习和模型蒸馏。
- DeepSeek-R1-Distill: 基于知识蒸馏,将 DeepSeek-R1 的能力蒸馏到低参数量模型,提升模型泛化能力。
五、新一代智能体
- LLM 与 Agent: LLM 是 Agent 的大脑,核心能力是逻辑推理,新一代智能体 = Agent + LLM。
- Agent 架构: 包括规划、工具使用、记忆等模块,实现自主化服务和任务执行。
- DeepSeek Agent: 从 LLM 到 Agent,实现时空智能的自主化服务,构建闭环多智能体协同系统。
六、大模型应用
- 应用层: 客服服务、OA 类、数据经营分析、运营工具等。
- 中间层: 基础模型层和通用类模型,如 DeepSeek 带来的全栈影响。
- 基础层: 通用类模型和垂类模型,如 DeepSeek 基础模型应用支持微调。