Предсказывать, чтобы выбирать действие
Исследуйте длинный горизонт и риск неверного прогноза.
Учебная симуляция · условные значения
Выигрыш сейчас или позже?
Два детерминированных пути без дисконтирования. Сравните прогноз модели с эталонным результатом примера.
| Путь | Шаг 1 | Шаг 2 | Шаг 3 | Σ |
|---|---|---|---|---|
| A | 4 | 0 | 0 | 4 |
| B | 0 | 0 | 9 | 0 |
| Путь | Шаг 1 | Шаг 2 | Шаг 3 | Σ |
|---|---|---|---|---|
| A | 4 | 0 | 0 | 4 |
| B | 0 | 0 | 9 | 0 |
Затемнённые шаги находятся за горизонтом.
Выбор модели : A
Лучший путь на этом горизонте по эталону : A
DreamerV3 обучает политику на воображаемых латентных траекториях. MuZero предсказывает награду, ценность и политику для поиска по дереву. Полное воссоздание мира не является их общей целью.
Проверить понимание
Прежде чем ответить, сформулируйте своё объяснение.
Более длинный горизонт может усилить последствия ошибочного прогноза.
Ключевая мысль
Прогнозы используются по-разному. Ошибки могут накапливаться; более далёкий взгляд не гарантирует лучший выбор. Этот пример не запускает указанные алгоритмы.
ПодробнееНаучные источники
- Hafner et al. · 2023Mastering Diverse Domains through World ModelsDreamerV3 · arXiv v2 · 2024Первичная публикация
- Schrittwieser et al. · 2019Mastering Atari, Go, Chess and Shogi by Planning with a Learned ModelarXiv v2 · 2020Первичная публикация
Учебное изложение указанных источников. Результаты публикаций ограничены их задачами, протоколами и ресурсами.