
StageWAM:面向机器人操作世界-动作模型的阶段联合嵌入预测
通用机器人策略旨在将多模态观测和语言任务指令映射为跨任务的动作。现有方法通常将未来表示为固定的短视频-动作块。本文区分了两种互补的未来:捕获局部场景演化的短期物理未来,以及表示任务进度的阶段级语义未来。提出StageWAM,在基于Motus的世界动作模型(WAM)上增加Stage-JEPA——一种目标条件联合嵌入预测架构。Stage-JEPA使用冻结的V-JEPA2编码器提取当前状态表示,预测下一推断阶段的潜在目标。在50个RoboTwin 2.0任务中,StageWAM实现90.25%总体成功率,成功回合平均执行步数较最强基线减少5.97%。
Xiao Liu, Yuguang Yang, Xi Wang2026年8月11日
联合嵌入预测架构WAM视觉语言动作模型2026年8月11日