本文へ移動
Transformer:注意の仕組み
アーキテクチャ、学習方法、システム全体を同じ階層で比較します。
学習用シミュレーション・架空の数値
数値例:1つのクエリと3つのキー
K = [[1,0],[0,1],[1,1]]、V = [[1,0],[0,1],[1,1]]、Q = [a,1]、dₖ = 2。演習用の数値です。
注意重み
K₁ 24.8 %
K₂ 24.8 %
K₃ 50.3 %
0 %25 %50 %75 %100 %
出力 = [0.752 ; 0.752]
自己回帰予測では因果マスクが未来の位置を除外します。射影、複数ヘッド、局所的な層、残差接続がTransformerを構成します。注意重みだけでは動作の因果的な説明にはなりません。
理解を確かめる
答える前に、自分の言葉で説明してみてください。
Transformer、拡散、MuZeroは、まったく同じ設計階層を表す。
概念から実践へ実践する
科学的な出典
- Vaswani et al. · 2017Attention Is All You NeedarXiv v7 · 2023原著論文
- Hochreiter & Schmidhuber · 1997Long Short-Term Memory原著論文
- Ho, Jain & Abbeel · 2020Denoising Diffusion Probabilistic Models原著論文
- Jain & Wallace · 2019Attention is not Explanation原著論文
引用した公開資料の学習用要約です。各論文の結果は、その課題、手順、計算資源の条件に依存します。