定义
Transformer结合注意力、位置信息与局部变换等组件。循环网络根据连续输入更新状态。架构说明如何计算,学习目标说明优化要改善什么。
缩放点积注意力
Q包含查询,K包含键,V包含值。QKᵀ除以√dₖ后,逐行softmax产生用于组合V的权重。
01
比较Q和K
Q [n_q × dₖ]
Kᵀ [dₖ × nₖ]
↓
QKᵀ [n_q × nₖ]02
逐行归一化
softmax(QKᵀ / √dₖ)
[n_q × nₖ]
Σⱼ wᵢⱼ = 103
加权组合V
W [n_q × nₖ]
V [nₖ × dᵥ]
↓
O [n_q × dᵥ]图中只有一个头。Q有n_q行,K和V有nₖ行;Q与K的列数都是dₖ。自注意力中它们由同一序列投影得到。
数值示例:一个查询,三个键假设与符号
自回归预测中的因果掩码排除未来位置。投影、多头、局部变换层和残差连接共同构成Transformer。注意力权重本身不是行为的因果证据。
解释的局限
扩散方法可以使用不同网络。DreamerV3和MuZero将组件组织成学习与决策系统。这些名称不是可互换的类别。
在正确层次上比较
- 架构
- Transformer · 循环网络
- 学习/生成方法
- 监督 · 自监督 · 强化 · 扩散
- 学习与决策系统
- DreamerV3 · MuZero