Transformers: механизм внимания
Сравнивайте архитектуры, методы и полные системы на подходящем уровне.
Учебная симуляция · условные значения
Числовой пример: один запрос, три ключа
K = [[1,0],[0,1],[1,1]], V = [[1,0],[0,1],[1,1]], Q = [a,1], dₖ = 2. Числа выбраны для упражнения.
Веса внимания
Выход = [0,752 ; 0,752]
Каузальная маска исключает будущие позиции при авторегрессионном прогнозе. Проекции, несколько голов, локальные слои и остаточные связи дополняют Transformer. Одни веса внимания не доказывают причинность поведения.
Проверить понимание
Прежде чем ответить, сформулируйте своё объяснение.
Transformer, диффузия и MuZero описывают один и тот же уровень проектирования.
Ключевая мысль
Диффузия может использовать разные сети. DreamerV3 и MuZero объединяют компоненты в системы обучения и решений. Эти названия не являются взаимозаменяемыми категориями.
ПодробнееНаучные источники
- Vaswani et al. · 2017Attention Is All You NeedarXiv v7 · 2023Первичная публикация
- Hochreiter & Schmidhuber · 1997Long Short-Term MemoryПервичная публикация
- Ho, Jain & Abbeel · 2020Denoising Diffusion Probabilistic ModelsПервичная публикация
- Jain & Wallace · 2019Attention is not ExplanationПервичная публикация
Учебное изложение указанных источников. Результаты публикаций ограничены их задачами, протоколами и ресурсами.