跳转到内容
预测以选择行动
探索更长的时域与错误预测的风险。
教学模拟 · 虚构数值
现在获益,还是以后获益?
两条确定性路径,无折扣。比较模型预测与玩具环境中的基准结果。
| 路径 | 步骤 1 | 步骤 2 | 步骤 3 | Σ |
|---|---|---|---|---|
| A | 4 | 0 | 0 | 4 |
| B | 0 | 0 | 9 | 0 |
| 路径 | 步骤 1 | 步骤 2 | 步骤 3 | Σ |
|---|---|---|---|---|
| A | 4 | 0 | 0 | 4 |
| B | 0 | 0 | 9 | 0 |
变暗的步骤在时域之外。
模型选择 : A
该时域下基准中的最佳路径 : A
DreamerV3利用想象的潜在轨迹学习策略。MuZero预测奖励、价值和策略以支持树搜索。重建世界的每个细节并非二者共同目标。
检查理解
回答前,先用自己的话解释。
更长的时域可能放大错误预测的影响。
科学来源
- Hafner et al. · 2023Mastering Diverse Domains through World ModelsDreamerV3 · arXiv v2 · 2024原始文献
- Schrittwieser et al. · 2019Mastering Atari, Go, Chess and Shogi by Planning with a Learned ModelarXiv v2 · 2020原始文献
基于所引公开资料的教学总结。论文结果受其任务、协议和资源预算约束。