Koopman Dreamer:用于稳定世界模型想象的谱约束隐式动力学隐式世界模型通过在想象的隐式轨迹上优化策略提高连续控制的样本效率,但常见神经转移对长滚动中的模态持续性和误差积累缺乏直接控制。Koopman Dreamer提出谱约束隐式动力学的Dreamer风格世界模型。Jiaqi Li, Xinglong Zhang, Haibin Xie·2026年7月22日DreamerKoopman世界模型2026年7月22日
世界模型记得,演员遗忘:用于持续基于模型强化学习的梦境复演DreamerV3系列基于模型的强化学习智能体在任务序列训练时灾难性遗忘,即使无限回放缓冲区保存了所有早期经验。本文研究持续RL文献假设但从未测量的问题:哪个组件遗忘最严重?提出梦境复演方法。Gurp Nijjer·2026年7月22日Dreamer世界模型持续学习2026年7月22日
Dreamer-CPC:基于世界模型的消息学习用于去中心化多智能体强化学习多智能体强化学习中,智能体间通信在部分可观测下有效提升性能。基于表示学习的方法让去中心化智能体学习基于自身观测的消息,但仅依赖当前观测。Dreamer-CPC结合世界模型进行消息学习。Taisuke Takayama, Naoto Yoshida, Tadahiro Taniguchi·2026年7月22日Dreamer世界模型多智能体2026年7月22日