Transformer架构的过去和现在
1.1 人脑带来的启示:数据的无损压缩
- 人类大脑:通过神经元数量、类型和连接方式的进化,实现高效信息处理。
- 自注意力机制:借鉴大脑注意力机制,通过计算输入序列各部分之间的相似度,为每个部分分配不同的权重,提升信息理解能力。
1.2 Transformer应运而生:Attention is all you need
- Transformer架构:由Google Brain团队提出,通过自注意力机制并行处理序列元素,显著提升训练速度和长距离依赖建模能力。
- 多头注意力机制:增强对输入数据细节的捕捉能力,通过多个并行注意力机制组合,扩展模型视野。
1.3 Transformer的优势:规模扩展、多模态能力
- 位置编码与并行化:通过位置编码赋予输入序列中各元素顺序信息,有效处理长距离依赖,提升训练效率。
- 跨模态应用:灵活性使其成为多模态任务的基础框架,能够将不同模态的数据映射到统一的特征表示空间。
Transformer架构的未来
2.1 Transformer架构的局限性
- 计算复杂度过高:源于其自注意力机制的Softmax Attention,导致计算复杂度较高。
2.2 Transformer架构的挑战者
- RetNet:并行与循环过程,实现训练并行性、良好性能和低推理成本。
- Mamba:改进现有研究,集中在修改块设计、扫描模式和记忆管理。
- RWKV:通过token shift计算流程,降低显存占用率。
- Hyena:通过特定算子结构和工作原理,提高模型效率。
- 线性注意力机制:减少计算复杂度,提高模型效率。
2.3 架构展望:更低计算复杂度、更低成本、更高效率
- 潜在替代架构:如RetNet、Mamba、RWKV、Hyena等,旨在降低计算复杂度和成本,提高模型效率。
- 多模态应用:跨模态任务中表现出色,如文本与图像处理,展现广阔的应用前景。