Robust-WAM:桥接世界-动作模型的生成式预训练与语义前瞻提出视频生成式世界-动作模型的通用后训练方法,保留 VAE 潜空间的生成路径并添加轻量语义前瞻对齐目标,用可学习查询 token 将未来场景语义引入动作流,使动作基于外观不变的动态表示,在 OOD 泛化仿真和真机上持续提升多种 WAM 基线成功率。Haodong Yan, Junfeng Li, Junjie He·2026年8月6日VAERobust-WAM世界模型2026年8月6日
FM-VLA:接触丰富操作的力觉记忆增强VLA模型提出基于力觉记忆的 VLA 模型,用 VAE 将力时序编码为紧凑记忆 token,注入动作专家模块,使模型能利用累积接触事件历史引导非马尔可夫接触丰富操作,在隐藏方块、按钮按压、擦拭盘子三个记忆依赖任务上超 80% 成功率。Ruicheng Li, Qixiu Li, Ruichun Ma·2026年7月20日视觉语言动作模型VAEFM-VLA2026年7月20日