Définition
Un Transformer combine notamment attention, transformations locales et information de position. Un réseau récurrent met à jour un état au fil des entrées. Une architecture indique comment calculer ; l’objectif d’apprentissage indique ce que l’optimisation cherche à améliorer.
L’attention à produit scalaire
Q contient les requêtes, K les clés, V les valeurs. Le produit QKᵀ est normalisé par √dₖ, puis softmax transforme chaque ligne en poids qui combinent V.
Comparer Q et K
Q [n_q × dₖ]
Kᵀ [dₖ × nₖ]
↓
QKᵀ [n_q × nₖ]Normaliser par ligne
softmax(QKᵀ / √dₖ)
[n_q × nₖ]
Σⱼ wᵢⱼ = 1Combiner les valeurs V
W [n_q × nₖ]
V [nₖ × dᵥ]
↓
O [n_q × dᵥ]Une seule tête est montrée. Q a n_q lignes, K et V ont nₖ lignes ; Q et K partagent dₖ colonnes. En auto-attention, ils sont projetés depuis la même séquence.
Exemple numérique : une requête, trois clésHypothèses et notation
Le masque causal interdit les positions futures lors d’une prédiction autorégressive. Les projections, têtes multiples, couches locales et connexions résiduelles complètent le Transformer. Les poids d’attention seuls ne constituent pas une preuve causale de son comportement.
Limites de l’interprétation
La diffusion est une méthode de modélisation et de génération qui peut utiliser différents réseaux. DreamerV3 et MuZero organisent plusieurs composants en systèmes d’apprentissage et de décision. Ces noms ne sont pas des catégories interchangeables.
Comparer les bons niveaux
- Architecture
- Transformer · Réseau récurrent
- Méthode d’apprentissage / génération
- Supervisé · auto-supervisé · renforcement · diffusion
- Système d’apprentissage et de décision
- DreamerV3 · MuZero