Transformers : comprendre l’attention
Comparer architectures, méthodes d’apprentissage et systèmes complets au bon niveau.
Simulation pédagogique · valeurs fictives
Exemple numérique : une requête, trois clés
K = [[1,0],[0,1],[1,1]], V = [[1,0],[0,1],[1,1]], Q = [a,1] et dₖ = 2. Ces nombres sont choisis pour l’exercice.
Poids d’attention
Sortie = [0,752 ; 0,752]
Le masque causal interdit les positions futures lors d’une prédiction autorégressive. Les projections, têtes multiples, couches locales et connexions résiduelles complètent le Transformer. Les poids d’attention seuls ne constituent pas une preuve causale de son comportement.
Vérifier ma compréhension
Avant de répondre, formulez votre explication.
Transformer, diffusion et MuZero décrivent exactement le même niveau de conception.
À retenir
La diffusion est une méthode de modélisation et de génération qui peut utiliser différents réseaux. DreamerV3 et MuZero organisent plusieurs composants en systèmes d’apprentissage et de décision. Ces noms ne sont pas des catégories interchangeables.
ApprofondirSources scientifiques
- Vaswani et al. · 2017Attention Is All You NeedarXiv v7 · 2023Publication originale
- Hochreiter & Schmidhuber · 1997Long Short-Term MemoryPublication originale
- Ho, Jain & Abbeel · 2020Denoising Diffusion Probabilistic ModelsPublication originale
- Jain & Wallace · 2019Attention is not ExplanationPublication originale
Synthèse pédagogique des sources citées. Les résultats des publications restent liés à leurs tâches, protocoles et budgets.