Определение
Transformer сочетает внимание, информацию о позиции и локальные преобразования. Рекуррентная сеть обновляет состояние с каждым входом. Архитектура задаёт вычисление, цель обучения — то, что улучшает оптимизация.
Масштабированное скалярное внимание
Q содержит запросы, K — ключи, V — значения. QKᵀ делится на √dₖ; построчный softmax даёт веса для объединения V.
Сравнить Q и K
Q [n_q × dₖ]
Kᵀ [dₖ × nₖ]
↓
QKᵀ [n_q × nₖ]Нормировать по строкам
softmax(QKᵀ / √dₖ)
[n_q × nₖ]
Σⱼ wᵢⱼ = 1Объединить значения V
W [n_q × nₖ]
V [nₖ × dᵥ]
↓
O [n_q × dᵥ]Показана одна голова. У Q n_q строк, у K и V — nₖ строк. У Q и K по dₖ столбцов. При самовнимании они проецируются из одной последовательности.
Числовой пример: один запрос, три ключаДопущения и обозначения
Каузальная маска исключает будущие позиции при авторегрессионном прогнозе. Проекции, несколько голов, локальные слои и остаточные связи дополняют Transformer. Одни веса внимания не доказывают причинность поведения.
Ограничения интерпретации
Диффузия может использовать разные сети. DreamerV3 и MuZero объединяют компоненты в системы обучения и решений. Эти названия не являются взаимозаменяемыми категориями.
Сравнивать на одном уровне
- Архитектура
- Transformer · Рекуррентная сеть
- Метод обучения / генерации
- С учителем · самообучение · подкрепление · диффузия
- Система обучения и принятия решений
- DreamerV3 · MuZero