PAPER DEEP DIVE
NavVerse:室内到室外连续具身导航基准——最强零样本 VLA 成功率仅 11.6%,跨越门槛后腰斩
密歇根大学 CURLY 实验室(CoRL 2026)发布 NavVerse:第一个把「室内→室外」连续具身导航放进物理仿真的基准。200 个场景(100 室内 + 50 室外城市 + 50 室内外连通)、10,000 条 episode、三类任务(ObjNav / VLN / 新提出的 PlaceNav 场所级导航)。场景建在 Isaac Sim 上,同时具备照片级视觉与可执行机器人动力学;室内外连通场景用「门到立面」装配,让机器人在同一物理世界无缝从走廊走进街道。评测覆盖成功(SR/SPL)、效率(CE 覆盖效率)与安全(CR 碰撞率 / ADO 障碍物间距 / NSR 可通行表面占比)三个正交维度。四个零样本基线全军覆没:最强 VLA(UniNaVid)ObjNav 11.62%、PlaceNav 11.38%、VLN 10.67%;模块化方法最安全但几乎不会探索;VLA-RL 策略障碍物间距最大却最常找错目标后草率停车。最刺眼的是过渡鸿沟:UniNaVid 从纯室外到室内外连通场景,PlaceNav 成功率 17.65%→3.64%(绝对降 14.01 点),且有 25–48% 的 episode 根本没能走出室内;所有方法出门后覆盖效率一致下降(表现为原地打转)。诊断实验另证明:同一条 oracle 轨迹,四足 Spot 两种摩擦下均 100% 走完,轮式 Turtlebot 只有 30.75–47.50%——忽略本体动力学的基准会系统性高估可执行性。现有工作多把室内外分开评测,且抽象掉机器人执行,NavVerse 补上的是「找出口、跨边界、出门后重新适应」这三个被集体忽略的阶段。
一篇论文,回答一个朴素的问题:今天的机器人能不能「走出家门」把事办成?
想象你对机器人说:「找个能吃到汉堡和薯条的地方。」这句话对人类几乎不构成挑战——出门、过马路、认出哪家是餐馆、走过去。但对今天的导航智能体,这条链路每一段都是深坑:要离开室内、跨入光照与结构完全不同的室外世界、理解「餐馆」这种场所级语义目标、再在符合机器人动力学约束的前提下真实地走过去。密歇根大学 CURLY 实验室(UMich-CURLY)在 CoRL 2026 发表的 NavVerse,就是第一个把这条完整链路放进物理仿真里系统评测的基准。
(走廊/货架间)"] --> B["寻找出口
Exit Finding"] B --> C["跨越边界
门洞→街面"] C --> D["室外适应
尺度/光照/地形剧变"] D --> E["场所级搜索
PlaceNav: 找餐馆/银行"] B -.-> F["Not Reached Outdoor
≈25–48% 卡在这一步"] C -.-> G["Post-Exit 效率骤降
CE 1.07→0.84"]
基准构成:200 个场景、10,000 条 episode、三种任务
NavVerse 建在 NVIDIA Isaac Sim 上,同时提供照片级渲染与物理感知的机器人执行——这是它与 Habitat 系(重视觉、轻物理)和 MuJoCo/Gazebo 系(重物理、缺视觉丰富度)的根本区别。场景分三类:100 个室内场景(来自 GRUtopia 的 GRScenes,覆盖公寓、超市、医院、办公室);50 个室外城市场景(来自 Virtual Community 的 Google 3D Tiles,每景约 1km×1km、平均 546 栋建筑、36.4km 道路);50 个室内→室外连通场景——通过「门到立面」(door-to-facade)装配把室内布局嵌进临街建筑:在立面开口、放入兼容的室内布局、对齐入口高度、删除遮挡门窗网格,让机器人在同一物理世界中无缝从走廊走进街道,没有传送、没有视角切换。
任务有三种:ObjNav(找到并接近指定物体类别)、VLN(跟随自然语言指令导航)、以及本文提出的新任务 PlaceNav——目标是「餐馆、咖啡馆、银行」这类功能场所而非具体物体,要求智能体推理路网拓扑、建筑立面与店面语义,做长时程目标搜索。episode 总量 10,000:ObjNav 4,027、PlaceNav 2,973、VLN 3,000。生成流程是三步闭环:NavMesh 离线采样起点到目标的可行路径 → 用真实机器人执行在线过滤不可行路径 → VLM 生成 VLN 指令并经人工网页端质检。为支撑 PlaceNav,作者用 Gemini 3 Pro Image 生成 101 种店面纹理(餐馆/咖啡馆/银行等)并按 OSM 店面位置通过射线投射贴到建筑立面,还从 Objaverse 121 个类别布置物体——每个室外场景最多 200 辆车、1,000 个街边物体,并有 30 组「情境物体组」(公交站配公文包和雨伞、长椅配笔记本和咖啡)提升语义真实性。
评测协议:把「安全」变成可以算分的指标
所有基线通过统一的可执行机器人接口评测:默认本体是波士顿动力 Spot(四足,RGB-D 输入),模型输出被转换为路点后由共享的 PID 路点跟随器执行,底层是 Isaac Lab 的运动控制策略(平地/粗糙地面/楼梯训练)。指标覆盖三个正交维度:任务完成(SR 成功率、SPL 路径加权成功率);探索效率(CE 覆盖效率——单位行驶距离新覆盖的空间量,对大尺度室外场景尤其关键);安全(CR 碰撞率、ADO 平均障碍物间距、NSR 可通行表面占比——机器人是否始终待在地形标注认可的表面上)。终止条件包括成功、超时、跌倒(重力向量与竖直轴夹角超限)、在错误目标处停止。这是一套把「物理可行性」写进分数的评测:纯室内基准上「贴着障碍物滑过去」的把戏,在这里会以碰撞率和跌倒计价。
结果:最强的零样本 VLA 也只有 17%,而且一出门就崩
四个基线——模块化语义导航 SGImagineNav、室内 RL 策略 PoliFormer、VLA 导航模型 UniNaVid、VLA-RL 策略 LongNav-R1——全部零样本评测。结论清晰而残酷:UniNaVid 拿到最好的零样本任务完成率(ObjNav 11.62%、PlaceNav 11.38%、VLN 10.67%),但绝对值仍然很低;模块化方法最安全(CR 最低 0.05、NSR 最高);LongNav-R1 障碍物间距最大(ADO 最高)却最常在错误目标处叫停(PlaceNav 失败中 87.1% 是 wrong-goal)。三个维度各有一个「冠军」,没有一个方法能同时兼顾成功、安全、效率——这正是真实部署的底线要求。
最有信息量的发现是过渡鸿沟(transition gap)。把最强基线 UniNaVid 的成绩按场景类型拆开:从纯室外到室内→室外连通场景,ObjNav 成功率 17.33%→8.42%(-8.91),VLN 14.00%→7.33%(-6.67),而 PlaceNav 从 17.65% 暴跌到 3.64%——绝对降幅 14.01 个百分点,相对跌幅近 80%。原因有二:VLN 主要靠指令跟随,能力跨域迁移相对稳定;PlaceNav 依赖拓扑感知的场所搜索,而室内外布局的拓扑逻辑截然不同,适应瓶颈最陡。
失败模式分析进一步定位了问题。出口寻找是隐藏关卡:纯室内/纯室外评测完全看不到这一失败——室内→室外 episode 中,UniNaVid 与 LongNav-R1 分别有 48.42% 和 47.37% 的 ObjNav episode 根本没能走到室外;表现最好的 SGImagineNav 也有 25.26%(ObjNav)/30.91%(PlaceNav)卡在同一关。出门后效率系统性下降:所有方法出口后的覆盖效率都低于出口前(UniNaVid ObjNav 1.07→0.84、PlaceNav 1.26→0.81、VLN 1.14→0.80)——研究者观察到智能体出门后常原地打转、来回折返,说明它们无法根据场景尺度和拓扑变化调整探索策略。室内外失败模式分工不同:室内失败多死于局部执行(PoliFormer 31.3%、SGImagineNav 43.0% 的室内 ObjNav 失败是跌倒);室外失败则转向探索与目标接地(PoliFormer 室外 ObjNav 失败 95.1% 是超时,LongNav-R1 室外 95.0% 是找错目标)。
诊断实验:路线越长错得越多,换成轮式腿就不听使唤
论文的诊断章节有三组很有味道的实验。难度分组:按路径长度三分位切 Easy/Medium/Hard,所有任务上 Hard 档一致拉低成功率——长时程导航的瓶颈不只是「认出目标」,而是探索、记忆、地形选择、指令接地与闭环控制的误差复利。本体动力学:同样的 oracle 参考轨迹,四足 Spot 在两种摩擦系数下都能 100% 走完,轮式 Turtlebot 成功率只有 30.75%–47.50%、速度掉到 0.36–0.58 m/s——一个忽略本体动力学的导航基准会系统性地高估运动学可行性,这就是物理仿真的不可替代性。指令格式:在 PlaceNav 上把「店铺类别」提示换成路线式 VLN 指令,SPL 从 3.30 升到 4.84(主要靠室外),但室内→室外 SR 纹丝不动(3.64%)——路线描述解决不了找出口问题;再加一层「意图→场所」推理的 Intention Driven 指令,成功率进一步掉到 4.07%,室内→室外直接归零。
它在评测版图里的位置
把 NavVerse 放回相关工作坐标系:Talk The Walk、TouchDown 用街景全景图做室外 VLN,但不可交互、无本体;R2R/RxR/HM3D-ObjNav 深耕室内,不越雷池一步;VLN-PE(2025)开始在 Isaac Sim 里做连续控制,但仍然只有室内。NavVerse 是第一个把「室内+室外+连通过渡」三种场景、三种任务、可执行机器人接口、安全指标装进同一个物理仿真平台的基准。它的两个诚实局限也值得记录:目前多数环境是单层网格(多层、天桥/空中连廊留作未来);动力学元素有限(行人和车辆、可开合的门在 roadmap 上),室外→室内反向过渡也未覆盖。
对领域而言,NavVerse 的价值不在刷榜——目前没有任何方法值得刷——而在把「走出家门」这个人人每天都在做、却从未被基准认真对待的能力,第一次变成可测量、可归因、可迭代的工程问题。出口寻找、边界跨越、出门后的策略再适应,这三个被旧基准集体忽略的阶段,现在有了各自的分数。下一次你看到机器人送货视频里流畅穿过玻璃门时,可以想想:在 NavVerse 里,最强模型还有 85% 的 PlaceNav episode 走不完这条路。
场景是怎么造出来的:从 OSM 路网到「喂猫」的情境组
NavVerse 场景管线的工程细节值得单独立一节,因为它定义了「跨语境导航」到底难在哪。室外侧从 Virtual Community 的 50 座城市出发,但原作者的网格只有稀疏的城市几何——NavVerse 做了四层增强。真实到仿真(real-to-sim)的地形:从 OSM 提取道路中心线与宽度(有 tag 用 tag,没有就按车道数和道路类型推导),转成道路轮廓多边形后压印到地形网格上,并在路面区域做统一深度凹陷——于是路面真的比人行道低一点、车轮真的会感觉到路缘石,这让「轨迹可行性」从语义题变成了物理题。表面语义与材质:地形分成建筑/人行道/车行道/水体/绿地五类,每类赋予不同外观与物理材质,策略在人行道和草地上会体验到不同摩擦与接触行为。情境化物体摆放:不做随机撒物,而是按地图区域语义条件采样——自行车停放区配车架和自行车、公交站配候车亭、公文包和雨伞、长椅区配笔记本和咖啡杯,甚至有 feeding_cat 组(猫+饭碗+奶瓶);新物体组与已有组保持距离以免过度杂乱。每个物体支持按尺寸和支持面堆叠(长椅上的包、桌上的玩具)。店面生成管线:Gemini 3 Pro Image 生成 101 种店面纹理与对应相对深度图,人工检查视觉合理性与语义一致性后,经 Blender 深度挤出转成 3D 网格,用射线投射找到最近的建筑立面、朝向最近道路、缩放对齐地形、在立面开匹配洞口——只有切割成功、朝街且无遮挡的店面才被接受。这套管线让 PlaceNav 的目标不只是贴图,而是有物理实体、有正确位置、可被接近的场所。
室内侧同样下了功夫:GRScenes 原始网格有 2,177 万个面,自动管线在 Blender 里做减面(decimation)、融边(dissolve)、重拓扑(remesh),面数砍掉 89.91% 而保留纹理材质——NavMesh 构建时间从 705ms 降到 107ms。NavMesh 用 C++ RecastNavigation 生成,室内用更细的体素(cell 0.05m)捕捉狭窄可通行区域,室外用 0.10m 粗分辨率换效率;最大爬升、最大坡度(45°)等参数直接编码了「机器人走得过」的物理约束,因此参考路径天然反映真实可走性。episode 的在线验证阶段要求 oracle 轨迹在全物理下 rollout 成功、时长与行驶距离落在预设区间、且不触发任何失败终止条件——不合格的 episode 直接淘汰。
三种动作接口与一份诚实的运行账单
NavVerse 不强迫智能体迁就评测器,而是提供三种动作接口任选:世界系路点路径(最通用)、离散动作(前进/左转/右转等基元,室内外步长不同——室外 0.5m 级、室内更小,旋转分大小档)、以及本体系速度指令(直接驱动运动策略、绕过 PID 控制器)。所有基线共享同一条底层执行栈:60Hz 运行、前视距离跟踪路点、PID 算速度并限幅(线速度/横移/角速度上限),限幅后的速度喂给与 Isaac Lab 默认结构相同的运动控制策略。这意味着「策略好但执行差」和「执行好但策略差」可以被干净地分离—— LongNav-R1 频繁在错误目标叫停是策略问题,PoliFormer 出门即超时则是探索策略与场景尺度不匹配的问题。
论文附录还给了一份少见的诚实运行账单:Isaac Sim 5.1.0 + Isaac Lab 2.3.0,物理步长 0.005s(200Hz),RTX 4090 渲染约 20FPS;单张 L40S(48GB)最多并行 3 个仿真实例,峰值显存室内约 9GB、室外与连通场景约 13GB;大规模评测用 4 张 L40S。对想复现或在这个基准上训练的团队,这组数字就是入场成本的直白报价。
为什么「过渡」比「室内」或「室外」都难:一个结构化视角
光照/纹理/尺度突变"] Q --> P2["空间重锚定
出口发现 + 边界跨越"] Q --> P3["策略再适应
探索方式随拓扑切换"] P1 --> R["旧基准的盲区:
室内外分开评,看不见这三层"] P2 --> R P3 --> R R --> S["NavVerse 的答案:
同一物理世界连续 episode +
成功/效率/安全三维分数"]
把失败数据摆进这个框架就很清楚:P2 是最陡的墙(25–48% 的 episode 根本到不了室外),P3 是最隐蔽的坑(所有方法出门后 CE 一致下降,且表现为原地打转这种「看起来在工作」的低效行为),P1 则更多体现在 PlaceNav 的拓扑级语义搜索上——室内找「医院里的前台」和街上找「银行」用的是两套完全不同的空间先验。VLN 的指令跟随能力之所以跨域最稳,恰是因为它把部分 P1/P3 的负担外包给了语言指令的显式结构。这给后续工作指出了一条明确的路:与其在单一语境里继续堆数据,不如显式建模过渡阶段——出口检测、边界状态、以及跨场景的探索策略迁移。
数据侧的三个统计图,其实是三份「考纲」
论文附录的三张矩形树图(treemap)读起来比正文更有意思,因为它们暴露了基准的「考纲倾向」。物体类别分布:购物车(4.0%)、沙发(3.8%)、桌子(3.3%)、货架(2.7%)领跑,垃圾车、救护车、警车、海鸥、水坑也在榜上,最长尾的类别各占 0.5%——这意味着 ObjNav 的目标分布刻意贴近日常语义而不是稀有物体,考验的是「看得懂生活」而非「背过长尾」。 POI/设施分布(PlaceNav 的目标考纲):餐馆一家独大占 20.6%,便利店 16.1%,快餐 9.9%,咖啡馆 7.6%,厕所 7.6%——吃喝加日常零售合计约六成,银行/ATM/货币兑换约 12.5%,学校、大学、图书馆、剧院、社区中心这些「文化类」合计不足一成。换句话说,PlaceNav 主要考的是城市里最高频的「去哪吃去哪买东西」能力,这也与推文里「找个能吃到汉堡和薯条的地方」的例子严丝合缝。指令动词分布(VLN 语言考纲):continue(9.7%)、move/keep(各 8.9%)、arrive(8.6%)、pass(7.8%)占了前几名,前 19 个动词覆盖约 83% 的出现次数——指令风格高度「路线式」,这与 Table 8 里「路线式指令比类别提示 SPL 更高」的发现互为印证。对想在 NavVerse 上刷分的团队,这三张图等于公开了出题人的偏好;对想批评基准的人,它们也提供了现成的弹着点:文化类场所与稀有物体占比偏低,赢家策略可能是「把吃喝零售的语义接地做扎实」。
读完这篇论文,应该带走什么
对研究者,NavVerse 给出了一份分工明确的「病历」:你的方法是像 UniNaVid 一样赢在完成率却输在安全(CR 偏高),还是像 SGImagineNav 一样稳但几乎不会探索(SR 个位数),抑或像 LongNav-R1 一样保持车距却在错误目标前草率停车——单一维度的分数在这里不再能伪装成整体能力。对工程师,它的启示更直接:如果你的机器人要在楼宇与街道之间工作,出口寻找与出门后的策略再适应是两个必须单独测试的模块,纯室内调参救不了它们。对整个社区,这篇论文最重要的贡献也许是一个「负结果基础设施」——它把当前 VLA/RL/模块化三条路线在同一把物理尺子上量了一遍,量出来的差距(最强 17%、过渡段再腰斩)足够喂饱接下来几年的方法研究。而「走出家门办成一件事」这个看似朴素的愿望,现在终于有了一个诚实的刻度。
引用
- 论文:NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation — arXiv:2607.19695(CoRL 2026)
- 项目主页:umich-curly.github.io/NavVerse-Benchmark
- 代码:github.com/UMich-CURLY/NavVerse-Benchmark
- 视频:@GhaffariMaani 演示视频(CoRL 2026)
