Prever para escolher uma ação
Explore horizontes longos e o risco de previsões incorretas.
Simulação didática · valores fictícios
Um ganho agora ou depois?
Dois caminhos determinísticos, sem desconto. Compare a previsão do modelo com o resultado de referência do exemplo.
| Caminho | Etapa 1 | Etapa 2 | Etapa 3 | Σ |
|---|---|---|---|---|
| A | 4 | 0 | 0 | 4 |
| B | 0 | 0 | 9 | 0 |
| Caminho | Etapa 1 | Etapa 2 | Etapa 3 | Σ |
|---|---|---|---|---|
| A | 4 | 0 | 0 | 4 |
| B | 0 | 0 | 9 | 0 |
As etapas esmaecidas estão fora do horizonte.
Escolha do modelo : A
Melhor caminho neste horizonte pela referência : A
DreamerV3 aprende uma política em trajetórias latentes imaginadas. MuZero prevê recompensa, valor e política para busca em árvore. Reconstruir cada detalhe do mundo não é seu objetivo comum.
Verificar meu entendimento
Antes de responder, formule sua explicação.
Um horizonte mais longo pode amplificar os efeitos de uma previsão equivocada.
Para lembrar
As previsões são usadas de formas diferentes. Erros podem se acumular; olhar mais longe não garante melhor decisão. O exemplo não executa nenhum desses algoritmos.
AprofundarFontes científicas
- Hafner et al. · 2023Mastering Diverse Domains through World ModelsDreamerV3 · arXiv v2 · 2024Publicação original
- Schrittwieser et al. · 2019Mastering Atari, Go, Chess and Shogi by Planning with a Learned ModelarXiv v2 · 2020Publicação original
Síntese didática das fontes citadas. Os resultados dependem das tarefas, protocolos e recursos de cada publicação.