跳转到内容动手实验
预测以选择行动
探索更长的时域与错误预测的风险。
要点
工作原理
世界模型预测环境演变中有用的方面。DreamerV3在潜在模型中利用想象轨迹学习行为。MuZero将与决策相关的学习模型和树搜索结合。
要记住的内容
两者使用预测的方式不同。模型误差可能累积;看得更远不保证决策更好。这个玩具示例不会运行上述算法。
科学来源
- Hafner et al. · 2023Mastering Diverse Domains through World ModelsDreamerV3 · arXiv v2 · 2024原始文献
- Schrittwieser et al. · 2019Mastering Atari, Go, Chess and Shogi by Planning with a Learned ModelarXiv v2 · 2020原始文献
基于所引公开资料的教学总结。论文结果受其任务、协议和资源预算约束。