定義
Transformerは注意、位置情報、局所的な変換などを組み合わせます。再帰型ネットワークは入力ごとに状態を更新します。アーキテクチャは計算方法、学習目的は最適化で改善する対象を定めます。
スケール付き内積注意
Qはクエリ、Kはキー、Vはバリューです。QKᵀを√dₖで割り、行ごとのsoftmaxでVを合成する重みを作ります。
01
QとKを比較
Q [n_q × dₖ]
Kᵀ [dₖ × nₖ]
↓
QKᵀ [n_q × nₖ]02
行ごとに正規化
softmax(QKᵀ / √dₖ)
[n_q × nₖ]
Σⱼ wᵢⱼ = 103
Vを重み付きで合成
W [n_q × nₖ]
V [nₖ × dᵥ]
↓
O [n_q × dᵥ]1つのヘッドを示します。Qはn_q行、KとVはnₖ行です。QとKの列数はdₖです。自己注意では同じ系列から射影します。
数値例:1つのクエリと3つのキー前提と記号
自己回帰予測では因果マスクが未来の位置を除外します。射影、複数ヘッド、局所的な層、残差接続がTransformerを構成します。注意重みだけでは動作の因果的な説明にはなりません。
解釈の限界
拡散は異なるネットワークを使えます。DreamerV3とMuZeroは複数の要素を学習・意思決定システムとして構成します。これらの名称は同列の分類ではありません。
比較する階層を揃える
- アーキテクチャ
- Transformer · 再帰型ネットワーク
- 学習・生成方法
- 教師あり・自己教師あり・強化学習・拡散
- 学習・意思決定システム
- DreamerV3 · MuZero