Transformer 架构是当前几乎所有大语言模型的基础。理解它对于深入 AI 领域至关重要。
## 为什么需要 Transformer?
在 Transformer 出现之前,RNN 和 LSTM 是序列建模的主流方案。但它们有两个致命问题:
– 无法并行计算
– 长距离依赖建模困难
## 核心组件
### Self-Attention(自注意力)
自注意力机制让模型在处理每个词时,能关注到序列中所有其他词。
计算过程:
1. 每个输入生成 Q(查询)、K(键)、V(值)三个向量
2. 计算 Q 与所有 K 的点积,得到注意力分数
3. 用 Softmax 归一化
4. 用归一化后的分数加权求和 V
### Multi-Head Attention(多头注意力)
将 Q、K、V 拆分成多个子空间,让模型从不同角度学习关联。
### Positional Encoding(位置编码)
因为 Self-Attention 本身没有顺序信息,所以需要额外的位置编码来保留词的顺序。
### Feed-Forward Network(前馈网络)
每个注意力层后接一个两层全连接网络,增加模型的表达能力。
## 整体结构
Transformer 采用 Encoder-Decoder 架构:
– Encoder:由 6 层相同的层堆叠,每层包含多头注意力和 FFN
– Decoder:类似 Encoder,但多了 Masked Self-Attention 和 Cross-Attention
## 影响
Transformer 不仅统治了 NLP 领域,近年还被成功应用到计算机视觉(ViT)、语音处理等领域。理解 Transformer 是理解 GPT、BERT 等模型的基础。