定義
世界モデルは環境変化の有用な側面を予測します。DreamerV3は潜在モデル内で想像した軌跡から行動を学びます。MuZeroは意思決定に必要なモデルと木探索を組み合わせます。
式
Gₕは割引係数γを使い、hステップの報酬rを合計します。この例ではγ = 1で、2つの決定論的経路を比較します。
前提と記号
Gₕは割引係数γを使い、hステップの報酬rを合計します。この例ではγ = 1で、2つの決定論的経路を比較します。
解釈の限界
予測の使い方は異なります。モデル誤差が蓄積するため、遠くを見るほど良い選択になるとは限りません。この演習はどちらのアルゴリズムも実行しません。
DreamerV3は潜在空間で想像した軌跡から方策を学びます。MuZeroは木探索のために報酬、価値、方策を予測します。世界の全詳細を再構成することが共通目的ではありません。