Prédire pour choisir une action
Explorer l’effet d’un horizon plus long et le risque d’un modèle inexact.
Simulation pédagogique · valeurs fictives
Un gain immédiat ou un gain plus tard ?
Deux chemins déterministes, sans actualisation. Comparez la prédiction du modèle au résultat de référence du jouet.
| Chemin | Étape 1 | Étape 2 | Étape 3 | Σ |
|---|---|---|---|---|
| A | 4 | 0 | 0 | 4 |
| B | 0 | 0 | 9 | 0 |
| Chemin | Étape 1 | Étape 2 | Étape 3 | Σ |
|---|---|---|---|---|
| A | 4 | 0 | 0 | 4 |
| B | 0 | 0 | 9 | 0 |
Les étapes grisées sont hors de l’horizon.
Choix du modèle : A
Meilleur chemin à cet horizon selon la référence : A
DreamerV3 apprend une politique sur des trajectoires latentes imaginées. MuZero prédit récompense, valeur et politique pour alimenter une recherche arborescente. Reconstituer chaque détail du monde n’est pas l’objectif commun.
Vérifier ma compréhension
Avant de répondre, formulez votre explication.
Un horizon plus long peut amplifier les conséquences d’une prédiction erronée.
À retenir
Ces systèmes n’utilisent pas leurs prédictions de la même manière. Des erreurs de modèle peuvent s’accumuler ; regarder plus loin n’est pas une garantie de meilleure décision. Le jouet ci-dessous n’exécute aucun de ces algorithmes.
ApprofondirSources scientifiques
- Hafner et al. · 2023Mastering Diverse Domains through World ModelsDreamerV3 · arXiv v2 · 2024Publication originale
- Schrittwieser et al. · 2019Mastering Atari, Go, Chess and Shogi by Planning with a Learned ModelarXiv v2 · 2020Publication originale
Synthèse pédagogique des sources citées. Les résultats des publications restent liés à leurs tâches, protocoles et budgets.