Definición
Un Transformer combina atención, información posicional y transformaciones locales. Una red recurrente actualiza un estado con cada entrada. La arquitectura define cómo se calcula; el objetivo de aprendizaje define qué mejora la optimización.
Atención de producto escalar escalado
Q contiene consultas, K claves y V valores. QKᵀ se escala por √dₖ; softmax por filas produce los pesos que combinan V.
Comparar Q y K
Q [n_q × dₖ]
Kᵀ [dₖ × nₖ]
↓
QKᵀ [n_q × nₖ]Normalizar por fila
softmax(QKᵀ / √dₖ)
[n_q × nₖ]
Σⱼ wᵢⱼ = 1Combinar los valores V
W [n_q × nₖ]
V [nₖ × dᵥ]
↓
O [n_q × dᵥ]Se muestra una cabeza. Q tiene n_q filas; K y V, nₖ filas. Q y K comparten dₖ columnas. En autoatención se proyectan desde la misma secuencia.
Ejemplo numérico: una consulta, tres clavesSupuestos y notación
La máscara causal excluye posiciones futuras en la predicción autorregresiva. Proyecciones, múltiples cabezas, capas locales y conexiones residuales completan el Transformer. Los pesos de atención no prueban por sí solos una explicación causal.
Límites de interpretación
La difusión puede utilizar distintas redes. DreamerV3 y MuZero organizan componentes en sistemas de aprendizaje y decisión. Sus nombres no son categorías intercambiables.
Comparar los niveles adecuados
- Arquitectura
- Transformer · Red recurrente
- Método de aprendizaje / generación
- Supervisado · autosupervisado · refuerzo · difusión
- Sistema de aprendizaje y decisión
- DreamerV3 · MuZero