
UniLM-Nav:面向零样本最后一米导航的统一框架
移动操作中,物体导航只把机器人送到目标附近,真正决定成败的是其后把基座调整到可操作位姿的最后一米。UniLM-Nav 用同一个 MLLM 后端把这一段显式分解为三个阶段:从短期观测记忆中按可见性与可接近性选出参考视角;把任务指令接地为归一化交互点,并用深度反投影提升为 3D affordance;再条件于该 3D 点、机器人构型与任务指令推理基座位置,朝向则由几何闭式解给出而非模型预测。框架完全零样本,在 HomeRobot OVMM 验证集上以 23.77% 的总体成功率超过此前最强的 MoTo 3.13 个百分点,13 个 MLLM 后端的对照显示具身空间数据微调的 4B 模型可胜过 235B 通用模型,真机在宇树 B2 四足加 Z1 机械臂平台上以 52.5% 的成功率完成闭环验证。
Zhuofan Zhang, Tianxu Wang, Guoxi Zhang2026年7月7日
移动操作Last-Mile NavigationAffordance Grounding2026年7月7日