1990–2026 · 五条技术脉络 · 33 个里程碑
61 篇站内收录论文 · 四条谱系 · 分类依据 arXiv:2605.12090
Google Gemini Robotics即将迎来重大更新,视频中双臂人形机器人暗示2.0版本即将到来。前作1.6版本已具备空间推理、多视角理解、任务规划与成功检测能力。
LimX Dynamics开源TRON 2 VLA模型,实现动态视觉感知、实时末端追踪与精准递送糖果,已在GitHub和HuggingFace发布。
提出 RL2 自适应推理时引导框架,在 VLA 动作专家潜空间上训练轻量离线 RL 策略,推理时将其流速度与冻结 VLA 组合,仅在预测失败时激活引导,在 SIMPLER 和 PolaRiS 基准上 OOD 场景成功率提升达 17.3%,真机实验验证迁移有效。
Derek Ming Siang Tan, Shailesh Shailesh, Srikrishna Iyer
在LIBERO上,mimic-video达到10倍样本效率和2倍收敛速度,单次演示即获77%成功率,因结构上区别于pi0等基于VQA的VLA模型。
ABot World 0.5B世界模型可在消费级GPU上实时运行,输入初始图像后用键盘控制,可本地运行或在线体验。
将扩散流操作策略变为反应式实时控制:快速本体感知通道+异步视觉通道+延迟自适应流调度,单步去噪每帧重规划,在真实机械臂上达 25Hz,成功率提升 30%。
Sungjae Park, Shubham Tulsiani
HiFi-UMI 提出端到端高保真便携数据采集系统,通过头戴立体 SLAM、GPIO 硬件同步触发和超宽视场双相机解决手持 UMI 的轨迹精度、双爪相对位姿、同步和视场缺陷。验证零机器人后训练假设:仅用高保真 UMI 数据后训练即可达到真机遥操作水平的可部署操作策略。
Simple AI, :, Yuteng Wei
DexRobot开源SO101抓取SFT与DM0.5 LoRA微调:仅用50条橙色方块数据微调后,实机成功将方块放入盘中。
CoorDex在潜空间协调身体与灵巧手运动先验,使人形机器人行走与操作同步;AnyBody从稀疏关键点实现全身协调控制并适应环境。
首次将触觉引入大规模具身基础模型预训练,在共享隐空间统一视觉、触觉、动作与未来世界动态
研究多回合长时程规划的物理,从预训练到后训练全流程,服务于世界模型与agent的长时程规划。
Tianyi Men, Zhuoran Jin, Kang Liu
提出τ方法,从未来视觉监督学习触觉增强的VLA模型,将触觉信号融入视觉-语言-动作框架。
Ning Cheng, Jinan Xu, Wanlin Li