定义
世界模型预测环境演变中有用的方面。DreamerV3在潜在模型中利用想象轨迹学习行为。MuZero将与决策相关的学习模型和树搜索结合。
公式
Gₕ使用折扣因子γ,将h步的奖励r相加。本例固定γ = 1,比较两条确定性路径。
假设与符号
Gₕ使用折扣因子γ,将h步的奖励r相加。本例固定γ = 1,比较两条确定性路径。
解释的局限
两者使用预测的方式不同。模型误差可能累积;看得更远不保证决策更好。这个玩具示例不会运行上述算法。
DreamerV3利用想象的潜在轨迹学习策略。MuZero预测奖励、价值和策略以支持树搜索。重建世界的每个细节并非二者共同目标。