RLT:Physical Intelligence 用「RL Token」让 VLA 在线 RL 攻克操作的最后一毫米
Physical Intelligence(Sergey Levine 团队,2026-03-19)发布 RL Token(RLT):冻结预训练 VLA,外挂编码器-解码器把内部嵌入压缩成信息瓶颈式的 RL token,再以约 1M 参数的 actor-critic 在真机上做在线 RL,只精修任务临界相位(编辑 VLA 动作块而非从零生成,BC 正则锚定 + 参考动作 dropout)。四个亚毫米级任务临界相位提速最高 3×,螺丝成功率 20%→65%,网线插入一半回合快过所有人类遥操作演示——只需 15 分钟真实机器人数据。
博客
视觉语言动作模型Online RLRLPDPhysical Intelligence灵巧操作