Definition
Ein Transformer kombiniert Aufmerksamkeit, Positionsinformation und lokale Transformationen. Ein rekurrentes Netz aktualisiert seinen Zustand mit jeder Eingabe. Architektur beschreibt die Berechnung; das Lernziel beschreibt das Optimierungsziel.
Skalierte Skalarprodukt-Aufmerksamkeit
Q enthält Abfragen, K Schlüssel und V Werte. QKᵀ wird durch √dₖ skaliert; zeilenweises Softmax liefert Gewichte für V.
Q und K vergleichen
Q [n_q × dₖ]
Kᵀ [dₖ × nₖ]
↓
QKᵀ [n_q × nₖ]Zeilenweise normalisieren
softmax(QKᵀ / √dₖ)
[n_q × nₖ]
Σⱼ wᵢⱼ = 1Werte V kombinieren
W [n_q × nₖ]
V [nₖ × dᵥ]
↓
O [n_q × dᵥ]Eine Kopfkomponente ist dargestellt. Q hat n_q Zeilen; K und V haben nₖ Zeilen. Q und K teilen dₖ Spalten. Bei Selbstaufmerksamkeit stammen sie aus derselben Sequenz.
Zahlenbeispiel: eine Abfrage, drei SchlüsselAnnahmen und Notation
Eine kausale Maske sperrt zukünftige Positionen bei autoregressiver Vorhersage. Projektionen, mehrere Köpfe, lokale Schichten und Residualverbindungen ergänzen den Transformer. Aufmerksamkeitsgewichte allein sind kein Kausalnachweis.
Grenzen der Interpretation
Diffusion kann verschiedene Netze verwenden. DreamerV3 und MuZero organisieren Komponenten zu Lern- und Entscheidungssystemen. Diese Namen bezeichnen keine austauschbaren Kategorien.
Die richtigen Ebenen vergleichen
- Architektur
- Transformer · Rekurrentes Netz
- Lern- / Generationsmethode
- Überwacht · selbstüberwacht · Verstärkung · Diffusion
- Lern- und Entscheidungssystem
- DreamerV3 · MuZero