跳转到内容
Transformer:理解注意力
在合适层次上比较架构、学习方法和完整系统。
教学模拟 · 虚构数值
数值示例:一个查询,三个键
K = [[1,0],[0,1],[1,1]],V = [[1,0],[0,1],[1,1]],Q = [a,1],dₖ = 2。这些数值仅用于练习。
注意力权重
K₁ 24.8 %
K₂ 24.8 %
K₃ 50.3 %
0 %25 %50 %75 %100 %
输出 = [0.752 ; 0.752]
自回归预测中的因果掩码排除未来位置。投影、多头、局部变换层和残差连接共同构成Transformer。注意力权重本身不是行为的因果证据。
检查理解
回答前,先用自己的话解释。
Transformer、扩散和MuZero描述的设计层次完全相同。
从概念到应用应用于实践
科学来源
- Vaswani et al. · 2017Attention Is All You NeedarXiv v7 · 2023原始文献
- Hochreiter & Schmidhuber · 1997Long Short-Term Memory原始文献
- Ho, Jain & Abbeel · 2020Denoising Diffusion Probabilistic Models原始文献
- Jain & Wallace · 2019Attention is not Explanation原始文献
基于所引公开资料的教学总结。论文结果受其任务、协议和资源预算约束。