К содержаниюЭксперимент
Предсказывать, чтобы выбирать действие
Исследуйте длинный горизонт и риск неверного прогноза.
Главное
Как это работает
Модель мира предсказывает полезные аспекты изменений среды. DreamerV3 обучает поведение на воображаемых траекториях в латентной модели. MuZero сочетает модель для принятия решений с поиском по дереву.
Ключевая мысль
Прогнозы используются по-разному. Ошибки могут накапливаться; более далёкий взгляд не гарантирует лучший выбор. Этот пример не запускает указанные алгоритмы.
Научные источники
- Hafner et al. · 2023Mastering Diverse Domains through World ModelsDreamerV3 · arXiv v2 · 2024Первичная публикация
- Schrittwieser et al. · 2019Mastering Atari, Go, Chess and Shogi by Planning with a Learned ModelarXiv v2 · 2020Первичная публикация
Учебное изложение указанных источников. Результаты публикаций ограничены их задачами, протоколами и ресурсами.