Odyssey 发布 PROWL-2:保真度门控双课程——让世界模型的失败变成策略进步的燃料,而不是策略错误的来源
Odyssey(联合 UCL AI Centre 与巴塞尔大学)10 月 1 日发布 PROWL-2:首个把「任务策略课程」与「世界模型修复课程」耦合进同一持续训练循环的框架。核心洞见:想象训练中高学习信号的轨迹是歧义的——可能是策略真弱点,也可能只是世界模型预测错了;不加分拣地优先学习等于强化模型自己的幻觉。PROWL-2 用一道保真度门把「有用」与「可信」分开判定:可信的高潜力想象经验进策略课表,不可信的连同其已存储的真实延续一起送进修复池,由随机初始化+KL 锚定的开发者策略在真实环境中修复,修好重审再放行。SMACv2 九场景全部第一(5v5 提 4–18%、10v10/10v11 提 20–91%);MQE 难任务大幅领先——Gate-3 70.4% vs 骨干 29.8%、Shepherd-Hard 28.2% vs 7.3%,其余基线全为 0。消融证明两份课表并非可加:只修不排课收益边际,只排课不加门在九个场景全部低于骨干,加门后同一套课程变成最大单项增益。框架对世界模型架构与 MARL 算法完全不可知,后续指向人形机器人协作与长视野多智能体游戏。
博客
PROWL-2世界模型MARL强化学习Curriculum Learning