Predecir para elegir una acción
Explora horizontes largos y el riesgo de predicciones inexactas.
Simulación didáctica · valores ficticios
¿Una ganancia ahora o después?
Dos caminos deterministas, sin descuento. Compara la predicción del modelo con el resultado de referencia del ejemplo.
| Camino | Paso 1 | Paso 2 | Paso 3 | Σ |
|---|---|---|---|---|
| A | 4 | 0 | 0 | 4 |
| B | 0 | 0 | 9 | 0 |
| Camino | Paso 1 | Paso 2 | Paso 3 | Σ |
|---|---|---|---|---|
| A | 4 | 0 | 0 | 4 |
| B | 0 | 0 | 9 | 0 |
Los pasos atenuados quedan fuera del horizonte.
Elección del modelo : A
Mejor camino a este horizonte según la referencia : A
DreamerV3 aprende una política sobre trayectorias latentes imaginadas. MuZero predice recompensa, valor y política para la búsqueda en árbol. Reconstruir cada detalle del mundo no es su objetivo común.
Comprobar lo aprendido
Antes de responder, formula tu explicación.
Un horizonte más largo puede amplificar los efectos de una predicción equivocada.
Qué recordar
Utilizan las predicciones de forma distinta. Los errores pueden acumularse; mirar más lejos no garantiza una mejor decisión. El ejemplo no ejecuta ninguno de esos algoritmos.
ProfundizarFuentes científicas
- Hafner et al. · 2023Mastering Diverse Domains through World ModelsDreamerV3 · arXiv v2 · 2024Publicación original
- Schrittwieser et al. · 2019Mastering Atari, Go, Chess and Shogi by Planning with a Learned ModelarXiv v2 · 2020Publicación original
Síntesis didáctica de las fuentes citadas. Los resultados dependen de las tareas, protocolos y recursos de cada publicación.