Transformers: Aufmerksamkeit verstehen
Architekturen, Lernmethoden und Gesamtsysteme passend vergleichen.
Lehrsimulation · fiktive Werte
Zahlenbeispiel: eine Abfrage, drei Schlüssel
K = [[1,0],[0,1],[1,1]], V = [[1,0],[0,1],[1,1]], Q = [a,1] und dₖ = 2. Die Zahlen dienen der Übung.
Aufmerksamkeitsgewichte
Ausgabe = [0,752 ; 0,752]
Eine kausale Maske sperrt zukünftige Positionen bei autoregressiver Vorhersage. Projektionen, mehrere Köpfe, lokale Schichten und Residualverbindungen ergänzen den Transformer. Aufmerksamkeitsgewichte allein sind kein Kausalnachweis.
Verständnis prüfen
Formulieren Sie vor der Antwort eine eigene Erklärung.
Transformer, Diffusion und MuZero beschreiben genau dieselbe Entwurfsebene.
Merksatz
Diffusion kann verschiedene Netze verwenden. DreamerV3 und MuZero organisieren Komponenten zu Lern- und Entscheidungssystemen. Diese Namen bezeichnen keine austauschbaren Kategorien.
VertiefenWissenschaftliche Quellen
- Vaswani et al. · 2017Attention Is All You NeedarXiv v7 · 2023Originalpublikation
- Hochreiter & Schmidhuber · 1997Long Short-Term MemoryOriginalpublikation
- Ho, Jain & Abbeel · 2020Denoising Diffusion Probabilistic ModelsOriginalpublikation
- Jain & Wallace · 2019Attention is not ExplanationOriginalpublikation
Didaktische Zusammenfassung der Quellen. Ergebnisse gelten im Rahmen der jeweiligen Aufgaben, Protokolle und Budgets.