1990–2026 · 五条技术脉络 · 33 个里程碑
61 篇站内收录论文 · 四条谱系 · 分类依据 arXiv:2605.12090
提出基于力觉记忆的 VLA 模型,用 VAE 将力时序编码为紧凑记忆 token,注入动作专家模块,使模型能利用累积接触事件历史引导非马尔可夫接触丰富操作,在隐藏方块、按钮按压、擦拭盘子三个记忆依赖任务上超 80% 成功率。
Ruicheng Li, Qixiu Li, Ruichun Ma
仿真与现实的差距仍是部署仿真训练机器人策略的根本挑战。World Translation通过反向动力学提取和无配对域翻译学习真实世界转移动力学,最小化sim-to-real差距。
Xinchen Yao, Leixin Chang, Hua Chen
提出持久物体令牌化(POT),从RGB-D观测维护角色索引3D物体记录并转换为动作专家的物体令牌,实现动作生成与几何谓词检验的闭环执行。POT-VLA在Unitree G1上将GR00T-N1.7基线从39/80提升至71/80,在Being-0对齐服务任务上达44/50。
Peng Ren, Haoyang Ge, Jiang Zhao
研究视觉语言agent中推理的架构与跨阶段鲁棒性,分析推理作为双刃剑的利弊,服务于VLA与agent设计。
Tuan Duong Trinh, Naveed Akhtar, Basim Azam
Unitree 发布 UnifoLM-OminiA-0.3:单一模型处理多样家居康养任务,全模态交互理解 + 完全自主、稳定抗扰执行,实时全身移动操作。
小米公布机器人缩放定律:Xiaomi-Robotics-1在10万小时真实UMI操作轨迹、1700+场景预训练,再用约1万小时跨本体机器人数据后训练,验证VLA缩放效果。
NVIDIA发布ArtiFixer研究,可修复不完整的3D高斯泼溅(Gaussian Splatting),填补缺失区域,将杂乱采集转化为更干净、更完整的3D场景。
NVIDIA发布生成式预训练控制器(GPC),为数字角色和机器人提供共享运动基础。一个控制器可复用平衡、协调、移动等技能,无需从零训练每个动作。
人形机器人照护演示:听指令从柜子取药、整理厨房、升高病床。来自 Untree 团队,采用 UnifoLM-OminiA-0.3 实时全模态交互驱动全身移动操作。
NVIDIA 提出 DéjàView(DVLT),一种用于多视角3D重建的循环 Transformer。通过共享帧/全局注意力块与离散深度索引循环,逐像素生成射线,实现高效多视角重建。
Sharpa Robotics发现双手63自由度机器人遥操作即使对老手也是噩梦,提出用VLA处理手内旋转(如旋转苹果),减轻操作者负担。
OpenBMB 开源 MiniCPM-Robot 具身 AI 模型系列,含 MiniCPM-RobotManip(1.5B 通用 VLA 操作模型),让 MiniCPM 进入物理世界理解、记忆与行动。