Définition
Un modèle du monde prédit des aspects utiles de l’évolution d’un environnement. DreamerV3 apprend des comportements sur des trajectoires imaginées dans un modèle latent. MuZero associe un modèle appris utile à la décision à une recherche arborescente.
Équation
Gₕ additionne les récompenses r sur h étapes, avec un facteur d’actualisation γ. Notre jouet fixe γ = 1 et compare deux chemins déterministes.
Hypothèses et notation
Gₕ additionne les récompenses r sur h étapes, avec un facteur d’actualisation γ. Notre jouet fixe γ = 1 et compare deux chemins déterministes.
Limites de l’interprétation
Ces systèmes n’utilisent pas leurs prédictions de la même manière. Des erreurs de modèle peuvent s’accumuler ; regarder plus loin n’est pas une garantie de meilleure décision. Le jouet ci-dessous n’exécute aucun de ces algorithmes.
DreamerV3 apprend une politique sur des trajectoires latentes imaginées. MuZero prédit récompense, valeur et politique pour alimenter une recherche arborescente. Reconstituer chaque détail du monde n’est pas l’objectif commun.