Vorhersagen, um zu entscheiden
Längere Horizonte und das Risiko falscher Vorhersagen erkunden.
Lehrsimulation · fiktive Werte
Gewinn jetzt oder später?
Zwei deterministische Pfade ohne Abzinsung. Vergleichen Sie Modellprognose und Referenzergebnis des Beispiels.
| Pfad | Schritt 1 | Schritt 2 | Schritt 3 | Σ |
|---|---|---|---|---|
| A | 4 | 0 | 0 | 4 |
| B | 0 | 0 | 9 | 0 |
| Pfad | Schritt 1 | Schritt 2 | Schritt 3 | Σ |
|---|---|---|---|---|
| A | 4 | 0 | 0 | 4 |
| B | 0 | 0 | 9 | 0 |
Abgeblendete Schritte liegen außerhalb des Horizonts.
Modellwahl : A
Bester Pfad bei diesem Horizont laut Referenz : A
DreamerV3 lernt eine Strategie anhand vorgestellter latenter Trajektorien. MuZero prognostiziert Belohnung, Wert und Strategie für die Baumsuche. Die Rekonstruktion jedes Weltdetails ist kein gemeinsames Ziel.
Verständnis prüfen
Formulieren Sie vor der Antwort eine eigene Erklärung.
Ein längerer Horizont kann Folgen einer falschen Vorhersage verstärken.
Merksatz
Die Vorhersagen werden unterschiedlich genutzt. Fehler können sich aufsummieren; weiter vorauszusehen garantiert keine bessere Wahl. Das Beispiel führt keinen dieser Algorithmen aus.
VertiefenWissenschaftliche Quellen
- Hafner et al. · 2023Mastering Diverse Domains through World ModelsDreamerV3 · arXiv v2 · 2024Originalpublikation
- Schrittwieser et al. · 2019Mastering Atari, Go, Chess and Shogi by Planning with a Learned ModelarXiv v2 · 2020Originalpublikation
Didaktische Zusammenfassung der Quellen. Ergebnisse gelten im Rahmen der jeweiligen Aufgaben, Protokolle und Budgets.