本文へ移動実験する
Transformer:注意の仕組み
アーキテクチャ、学習方法、システム全体を同じ階層で比較します。
要点
仕組み
Transformerは注意、位置情報、局所的な変換などを組み合わせます。再帰型ネットワークは入力ごとに状態を更新します。アーキテクチャは計算方法、学習目的は最適化で改善する対象を定めます。
覚えておきたいこと
拡散は異なるネットワークを使えます。DreamerV3とMuZeroは複数の要素を学習・意思決定システムとして構成します。これらの名称は同列の分類ではありません。
比較する階層を揃える
- アーキテクチャ
- Transformer · 再帰型ネットワーク
- 学習・生成方法
- 教師あり・自己教師あり・強化学習・拡散
- 学習・意思決定システム
- DreamerV3 · MuZero
概念から実践へ実践する
科学的な出典
- Vaswani et al. · 2017Attention Is All You NeedarXiv v7 · 2023原著論文
- Hochreiter & Schmidhuber · 1997Long Short-Term Memory原著論文
- Ho, Jain & Abbeel · 2020Denoising Diffusion Probabilistic Models原著論文
- Jain & Wallace · 2019Attention is not Explanation原著論文
引用した公開資料の学習用要約です。各論文の結果は、その課題、手順、計算資源の条件に依存します。