本文へ移動
行動を選ぶために予測する
長い見通しと、不正確な予測のリスクを調べます。
学習用シミュレーション・架空の数値
今の報酬か、後の報酬か?
割引のない2つの決定論的な経路です。モデルの予測と、この例の基準結果を比べます。
| 経路 | ステップ 1 | ステップ 2 | ステップ 3 | Σ |
|---|---|---|---|---|
| A | 4 | 0 | 0 | 4 |
| B | 0 | 0 | 9 | 0 |
| 経路 | ステップ 1 | ステップ 2 | ステップ 3 | Σ |
|---|---|---|---|---|
| A | 4 | 0 | 0 | 4 |
| B | 0 | 0 | 9 | 0 |
薄く表示されたステップは見通しの範囲外です。
モデルの選択 : A
基準結果での最良の経路 : A
DreamerV3は潜在空間で想像した軌跡から方策を学びます。MuZeroは木探索のために報酬、価値、方策を予測します。世界の全詳細を再構成することが共通目的ではありません。
理解を確かめる
答える前に、自分の言葉で説明してみてください。
見通しを長くすると、誤った予測の影響が大きくなることがある。
科学的な出典
- Hafner et al. · 2023Mastering Diverse Domains through World ModelsDreamerV3 · arXiv v2 · 2024原著論文
- Schrittwieser et al. · 2019Mastering Atari, Go, Chess and Shogi by Planning with a Learned ModelarXiv v2 · 2020原著論文
引用した公開資料の学習用要約です。各論文の結果は、その課題、手順、計算資源の条件に依存します。