RT-2:把视觉与语言直接变成机器人动作

视频加载中
视频加载中RT-2 将动作表示为 token,让视觉语言模型直接充当机器人控制器;借助网络规模预训练,对陌生物体与任务展现更强泛化,甚至能做简单语义推理。
Category: research
Author: @Alacritic_Super
Date: 2026-09-22T00:00:00
Duration: 112.228s
Reference: https://arxiv.org/abs/2307.15818

RT-2 将动作表示为 token,让视觉语言模型直接充当机器人控制器;借助网络规模预训练,对陌生物体与任务展现更强泛化,甚至能做简单语义推理。
0:27
0:17
4:22
0:30
0:07
1:00