
时序视触觉学习:抬起前预判灵巧抓取稳定性
机器人抓取研究大多用视觉选位姿、配平行夹爪,而人是靠指尖触觉几乎不失手。TU Dresden LASR Lab 把问题改成「抬起之前这只多指手抓稳了没」:7 自由度 xArm7 + 16 自由度 Tilburg Hand,四指尖各嵌一颗 Digit 360,用 200 个物体(刚性 105、可形变 95)自动采集 10000 次抓取,全程录外部 RGB-D、本体感知与四路触觉(相机/音频/IMU/气压),SAM 3 检测抬起后物体高度自动打标(与人工核验一致率 92.34%)。模型是以抓取起始为锚点的 3 秒观测窗:16 帧 RGB 与触觉图像走 VideoMAEv2-Base,本体感知 100 步、音频等 224 步走 Transformer,四指触觉先跨模态融合再跨时间跨手指分解注意力,最后注意力融合输出稳定概率。5 折物体不相交验证下视觉+本体+触觉 83.55%,去掉触觉掉到 79.56%;触觉分辨率 1x1→112x112 准确率 79.40%→83.55%;把触觉冻结成最后一帧掉 2.07 个百分点。真机上把它当在线门控(阈值 0.95,最多重抓 5 次),20 个训练集外物体上执行抬起的成功率 82.0%,比无触觉门控高 10.5 个百分点。约 1.2TB 数据集已在 OPARA 公开。
Ken Nakahara, Aleksei Buvailik, Prokhor Kotov2026年10月7日
灵巧操作触觉Visuo-Tactile2026年10月7日