Definição
Um Transformer combina atenção, informação posicional e transformações locais. Uma rede recorrente atualiza estado a cada entrada. A arquitetura define como calcular; o objetivo de aprendizagem define o que a otimização melhora.
Atenção por produto escalar escalado
Q contém consultas, K chaves e V valores. QKᵀ é escalado por √dₖ; softmax por linha produz os pesos que combinam V.
Comparar Q e K
Q [n_q × dₖ]
Kᵀ [dₖ × nₖ]
↓
QKᵀ [n_q × nₖ]Normalizar por linha
softmax(QKᵀ / √dₖ)
[n_q × nₖ]
Σⱼ wᵢⱼ = 1Combinar os valores V
W [n_q × nₖ]
V [nₖ × dᵥ]
↓
O [n_q × dᵥ]Uma cabeça é mostrada. Q tem n_q linhas; K e V têm nₖ linhas. Q e K compartilham dₖ colunas. Na autoatenção, são projetados da mesma sequência.
Exemplo numérico: uma consulta, três chavesHipóteses e notação
A máscara causal exclui posições futuras na previsão autorregressiva. Projeções, várias cabeças, camadas locais e conexões residuais completam o Transformer. Pesos de atenção isolados não provam uma explicação causal.
Limites da interpretação
A difusão pode usar redes diferentes. DreamerV3 e MuZero organizam componentes em sistemas de aprendizagem e decisão. Esses nomes não são categorias intercambiáveis.
Comparar os níveis corretos
- Arquitetura
- Transformer · Rede recorrente
- Método de aprendizagem / geração
- Supervisionado · autossupervisionado · reforço · difusão
- Sistema de aprendizagem e decisão
- DreamerV3 · MuZero