
RL2-VLA:VLA 模型自适应 RL 潜空间组合引导与测试时扩展
提出 RL2 自适应推理时引导框架,在 VLA 动作专家潜空间上训练轻量离线 RL 策略,推理时将其流速度与冻结 VLA 组合,仅在预测失败时激活引导,在 SIMPLER 和 PolaRiS 基准上 OOD 场景成功率提升达 17.3%,真机实验验证迁移有效。
Derek Ming Siang Tan, Shailesh Shailesh, Srikrishna Iyer2026年7月29日
视觉语言动作模型RL2-VLA强化学习2026年7月29日