Transformers: entender a atenção
Compare arquiteturas, métodos e sistemas completos no nível correto.
Simulação didática · valores fictícios
Exemplo numérico: uma consulta, três chaves
K = [[1,0],[0,1],[1,1]], V = [[1,0],[0,1],[1,1]], Q = [a,1] e dₖ = 2. Números escolhidos para o exercício.
Pesos de atenção
Saída = [0,752 ; 0,752]
A máscara causal exclui posições futuras na previsão autorregressiva. Projeções, várias cabeças, camadas locais e conexões residuais completam o Transformer. Pesos de atenção isolados não provam uma explicação causal.
Verificar meu entendimento
Antes de responder, formule sua explicação.
Transformer, difusão e MuZero descrevem exatamente o mesmo nível de projeto.
Para lembrar
A difusão pode usar redes diferentes. DreamerV3 e MuZero organizam componentes em sistemas de aprendizagem e decisão. Esses nomes não são categorias intercambiáveis.
AprofundarFontes científicas
- Vaswani et al. · 2017Attention Is All You NeedarXiv v7 · 2023Publicação original
- Hochreiter & Schmidhuber · 1997Long Short-Term MemoryPublicação original
- Ho, Jain & Abbeel · 2020Denoising Diffusion Probabilistic ModelsPublicação original
- Jain & Wallace · 2019Attention is not ExplanationPublicação original
Síntese didática das fontes citadas. Os resultados dependem das tarefas, protocolos e recursos de cada publicação.