Transformers: entender la atención
Compara arquitecturas, métodos y sistemas completos al nivel adecuado.
Simulación didáctica · valores ficticios
Ejemplo numérico: una consulta, tres claves
K = [[1,0],[0,1],[1,1]], V = [[1,0],[0,1],[1,1]], Q = [a,1] y dₖ = 2. Los números son didácticos.
Pesos de atención
Salida = [0,752 ; 0,752]
La máscara causal excluye posiciones futuras en la predicción autorregresiva. Proyecciones, múltiples cabezas, capas locales y conexiones residuales completan el Transformer. Los pesos de atención no prueban por sí solos una explicación causal.
Comprobar lo aprendido
Antes de responder, formula tu explicación.
Transformer, difusión y MuZero describen exactamente el mismo nivel de diseño.
Qué recordar
La difusión puede utilizar distintas redes. DreamerV3 y MuZero organizan componentes en sistemas de aprendizaje y decisión. Sus nombres no son categorías intercambiables.
ProfundizarFuentes científicas
- Vaswani et al. · 2017Attention Is All You NeedarXiv v7 · 2023Publicación original
- Hochreiter & Schmidhuber · 1997Long Short-Term MemoryPublicación original
- Ho, Jain & Abbeel · 2020Denoising Diffusion Probabilistic ModelsPublicación original
- Jain & Wallace · 2019Attention is not ExplanationPublicación original
Síntesis didáctica de las fuentes citadas. Los resultados dependen de las tareas, protocolos y recursos de cada publicación.