本文へ移動実験する
行動を選ぶために予測する
長い見通しと、不正確な予測のリスクを調べます。
要点
仕組み
世界モデルは環境変化の有用な側面を予測します。DreamerV3は潜在モデル内で想像した軌跡から行動を学びます。MuZeroは意思決定に必要なモデルと木探索を組み合わせます。
覚えておきたいこと
予測の使い方は異なります。モデル誤差が蓄積するため、遠くを見るほど良い選択になるとは限りません。この演習はどちらのアルゴリズムも実行しません。
科学的な出典
- Hafner et al. · 2023Mastering Diverse Domains through World ModelsDreamerV3 · arXiv v2 · 2024原著論文
- Schrittwieser et al. · 2019Mastering Atari, Go, Chess and Shogi by Planning with a Learned ModelarXiv v2 · 2020原著論文
引用した公開資料の学習用要約です。各論文の結果は、その課題、手順、計算資源の条件に依存します。