PAPER DEEP DIVE
稀疏视频导航 SparseVideoNav:视频生成模型攻克「视野外导航」,夜间 BVN 首次跑通、成功率 2.5 倍于 SOTA
港大与 OpenDriveLab 提出 SparseVideoNav:用视频生成模型(VGM)替代 LLM 承载长时程预知,只预测稀疏关键帧(间隔 3,覆盖 20 秒)就把 BVN 平均成功率推到 25.0%、2.5 倍于最强 LLM 基线;PCM 蒸馏 + 稀疏化带来 27 倍端到端加速(推理 21.6s→0.8s),自建 140 小时真实导航数据集,并在夜间场景首次实现 BVN 能力。本文精读其稀疏设计、四阶段训练流水线与 240 次真实机器人试验细节。
一句话概括与背景:为什么「看不到目标」才是真问题
如果说过去两年视觉语言导航(Vision-Language Navigation, VLN)的进步主要来自把大语言模型(LLM)接到机器人身上,那么来自香港大学与 OpenDriveLab 的这篇 SparseVideoNav 提出的问题就更尖锐:为什么导航一定要绑定详细、冗长的语言指令?现实的家庭或园区里,人类说出口的往往是「找一下桌子然后停在旁边」「去前面找找垃圾桶」,而不是把每个转弯、每段走廊、每个岔口都写清楚。研究团队把这种只有高层意图、目标远在视野之外的设定称为 Beyond-the-View Navigation(BVN,视野外导航),并把它与传统的 Instruction-Following Navigation(IFN,指令跟随导航)明确区分开来。
论文的核心诊断是:现有 LLM 导航方法在 BVN 上会系统性地「近视」。它们在训练时受到的是短视距监督——通常只有 4 到 8 步的动作序列,因此模型被迫从极短的因果链里去推断长期意图。这种监督方式在部署时暴露出两种典型失败模式:其一,在长距离上根本看不到目标,不确定性急剧放大,于是出现乱转、原地打转;其二,走进死胡同时误判为「路到头了」,导致死胡同卡死。作者指出,直觉上的解法——直接把监督时域拉长——并不可行,因为延长时域会破坏 LLM 的训练稳定性。
于是论文提出了一个范式层面的转向:使用视频生成模型(Video Generation Model, VGM)。关键洞察在于,VGM 天生就是在「以语言为条件、预测长时程未来」这一目标上预训练出来的,它的表征天然对齐长时程的视觉演化;相比之下,LLM 的语言 token 空间并不携带这种时空先验。作者因此认为 VGM 是承载 BVN 所需「长时程预知(long-horizon foresight)」的天然接口。
核心创新:不生成完整视频,只生成「稀疏未来」
但论文并没有照搬标准的视频生成范式。作者追问了一个更有意思的问题:为了导航,真的需要连续、高帧率的未来视频吗?答案是否定的。连续性所要求的高频时序细节,对「往哪走」这个决策而言是冗余的。这一判断直接催生了论文最重要的技术主张——稀疏视频生成(sparse video generation):不预测每一帧,而是只预测精心挑选的关键时间步上的稀疏帧,并把这些稀疏帧作为 VGM 的直接监督信号。
这样做换来两个收益:预测时域被显著拉长(因为同样数量的预测帧覆盖了更长的时间跨度),同时训练与推理开销反而下降。论文通过实验确定了稀疏间隔的最优值:间隔设为 3 时,模型能够在预测时域与视觉保真度之间取得最好的平衡。间隔为 1(逐帧预测)虽然画质好,但预测时域太短,模型根本「看」不到远处的目标;间隔为 5 虽然时域更长,但画面出现明显的保真度退化(fidelity degradation),模糊失真同样会损害目标识别。
为了兼顾动作预测的精度,作者保留了前两个观测块的连续生成(覆盖 8 个时间步),最终形成的稀疏生成时间步为 [T+1, T+2, T+5, T+8, T+11, T+14, T+17, T+20],在 4 FPS 下覆盖 20 秒的预测时域。其中 T 表示当前时刻。这正是 SparseVideoNav 能够在「亚秒级」完成轨迹推理的基础。
历史观测 H"] --> B["历史压缩
Q-Former 时间维 + Video-Former 空间维"] L["语言指令 l
umT5 编码"] --> C["VGM 主干
Wan2.1-1.3B"] B --> C A --> C C --> D["稀疏未来潜变量
T+1,T+2,T+5,...,T+20
20 秒 @ 4 FPS"] D --> E["DiT 动作头
交叉注意力注入指令"] E --> F["连续动作
a_0"] G["DA3 重标注生成帧"] --> E
四阶段训练流水线:从文本生视频到动作学习
把「稀疏预知」落地成一个可部署的导航系统,论文面对两个工程挑战:其一,注入完整历史 + 生成动态场景所需的去噪步数,会带来难以在真实机器人上承担的推理延迟;其二,与 LLM 方法可以通过异构真实数据联合训练来弥合仿真—现实鸿沟不同,VGM 缺乏这种直接机制。作者用四阶段训练流水线和一套自建真实导航数据集分别回应这两点。
第一阶段:T2V → I2V。主干采用 Wan2.1-1.3B 的文生视频(T2V)模型,它通过 3D 因果 VAE 压缩时空维度:输入视频被编码成若干潜变量块(chunk),每个块的形状为 [H/8, W/8, 16],后续所有训练都在块级别进行。由于 T2V 主要依据语言生成未来、而非依据视觉输入,因此第一阶段的目标是把它适配为图生视频(I2V),确保生成未来与初始观测保持一致。微调沿用 Wan 原有的 flow matching 目标:给定当前块的潜变量、稀疏目标帧 x₁、随机噪声 x₀ 与采样自 logit-normal 分布的时间步 t,构造中间潜变量 x_t = t·x₁ + (1−t)·x₀,真值速度为 v_t = x₁ − x₀,损失即模型预测速度与真值速度的均方误差。
第二阶段:历史注入。导航基础模型与一般视觉—语言—动作模型的关键差别在于必须纳入完整历史观测,而 VGM 天生不具备处理长序列图像 token 的能力(这一点与 LLM 相反)。作者借鉴 CDiT 架构,在 Wan 主干的每个 transformer 块中额外插入一个交叉注意力块来显式注入历史;为保留微调后 I2V 模型的生成先验,这些新块的最后一层线性层被零初始化。历史本身长度和维度都过高,于是采用两步压缩:先用 Q-Former 处理时间维特征,再用 Video-Former 处理空间维特征,得到历史嵌入 h_T 后并入训练目标。
第三阶段:扩散蒸馏。导航场景与机械臂操作不同——操作任务的视觉变化有限,少步去噪即可高保真重建;而导航涉及高度剧烈的场景转换,少步生成高保真未来帧本身就困难,这正是真实部署的瓶颈所在(已有的自动驾驶视频生成方法动辄需要数十秒到数分钟)。作者把 PCM 适配到 flow matching 范式,对历史注入后的 I2V 模型做蒸馏:以该模型为教师,复制一份结构完全相同的学生并用相同权重初始化,把噪声调度划分为 4 个阶段,让学生学习在教师模型概率流 ODE 轨迹上预测每个阶段的解点,通过最小化相邻时间步之间的一致性损失,把推理步数从 N = 50 逐步蒸馏到 M = 4。
第四阶段:动作学习。作者冻结蒸馏后的 I2V 模型,采用逆动力学范式预测连续动作:把生成的稀疏未来与语言指令通过交叉注意力注入一个基于 DiT 的动作头。这里有一个非常诚实且关键的工程细节——作者观察到生成帧与原始真值未来帧之间存在明显的视觉差异,导致「合成动力学」与「原始动作标签」错位;为消除这种不一致,他们用 DA3(Depth Anything 3)对生成帧重新打标,从而保证动作监督精确对齐。训练采用 DDIM,学习一个去噪函数去逼近噪声。
数据构造:140 小时真实世界导航视频
论文没有回避数据问题,反而把它当作系统性贡献来对待。作者明确说明:他们无法沿用 LLM 导航方法那种「仿真导航数据 + 真实 VQA 数据联合训练」的策略,因为仅靠仿真数据会因域差过大而导致模式崩塌;而现有真实导航数据集又普遍具有严重的鱼眼畸变、规模有限,不适合微调 VGM。
因此团队自建了一条数据构造流水线:由人类操作员手持相机采集多样化视频,为抑制人手抖动影响 VGM 学习一致的动力学,明确采用带 RockSteady+ 增稳的 DJI Osmo Action 4。最终采集 140 小时真实世界导航视频,经均匀时间采样处理为约 13,000 条轨迹,平均长度 140 帧 @ 4 FPS。随后使用 Depth Anything 3(DA3)估计相机位姿,从中提取连续动作标签,语言指令则由人类专家手工标注。作者称这是迄今最大的真实世界 VLN 数据集,并承诺向社区开源。
实验设置:六场景、240 次试验、以「距离」定义成功
评测在真实世界展开,选择了六个未见过的场景,覆盖三大类:室内(房间、实验楼)、室外(庭院、公园)、夜间(广场、山地),以检验零样本泛化能力。每个场景设计四个不同的导航任务,其中两个是标准 IFN 任务、两个是具有挑战性的 BVN 任务。为保证统计可靠性,每个模型在每个任务上测试 10 次,总计 240 次试验。
对比基线有三个强 LLM 方法:统一多种导航任务的视频 LLM Uni-NaVid、通过 KV Cache 加速推理的流式框架 StreamVLN、以及首个面向 VLN 的双系统 LLM 模型 InternVLA-N1。这里有一个值得称道的评测细节:作者发现 LLM 基线常常以侧向姿态停在目标旁,而自己的模型通常正面朝向目标停下;为保证公平,他们仅以距离定义成功——机器人停在目标 1.5 米以内即算成功。此外,所有模型的对比测试都被安排在同一时间窗口内完成,以最小化时间与天气带来的环境差异。
硬件部署基于 Unitree Go2 机器狗,配备一台朝上的 DJI Osmo Action 4 提供增稳 RGB 观测;由于 InternVLA-N1 需要深度输入,额外按原配置搭载 Intel RealSense D455(向下俯仰 15°)采集 RGB-D。相机通过定制 3D 打印支架固定在 Go2 背部,离地高度约 1 米,且该高度在所有评测方法间保持统一。计算在一台配备 RTX 4090 的远程工作站上完成:Go2 持续把视觉观测发送到服务器,服务器处理后回传导航动作指令,机器人执行。
主结果:BVN 成功率 2.5 倍于 SOTA,夜间首次跑通
结果非常干净:SparseVideoNav 在所有真实场景、IFN 与 BVN 两类任务上一致取得 SOTA 零样本性能。相对最强基线 StreamVLN,平均成功率在 IFN 上 +15.0%、在 BVN 上 +15.0%。更关键的是绝对水平:BVN 平均成功率 25.0% 对 10.0%,即 2.5 倍(这正是摘要中的核心数字)。
| 方法 | 室内 IFN | 室内 BVN | 室外 IFN | 室外 BVN | 夜间 IFN | 夜间 BVN | 平均 IFN | 平均 BVN |
|---|---|---|---|---|---|---|---|---|
| Uni-NaVid | 15.0 | 2.5 | 15.0 | 5.0 | 0.0 | 0.0 | 10.0 | 2.5 |
| StreamVLN | 42.5 | 12.5 | 40.0 | 17.5 | 22.5 | 0.0 | 35.0 | 10.0 |
| InternVLA-N1 | 20.0 | 2.5 | 32.5 | 22.5 | 0.0 | 0.0 | 17.5 | 8.3 |
| SparseVideoNav | 55.0 | 27.5 | 57.5 | 30.0 | 37.5 | 17.5 | 50.0 | 25.0 |
夜间场景是最有说服力的一组证据。作者指出,能见度的降低会进一步放大「近视」缺陷,导致所有既有基线在 BVN 任务上系统性失效;而 SparseVideoNav 凭借稳健的长时程引导,成为唯一能在这类极端环境中抵达远处目标的方法,并以 17.5% 的成功率首次实现夜间 BVN 能力。定性结果(论文图 4)进一步展示了它穿越死胡同、狭窄可通行坡道、以及高倾角山坡的能力。
论文还分析了「为什么有效」(论文图 5):LLM 基线受短时距监督所限,在长距离不确定性下出现意外转向、在死胡同中过早受困;而 SparseVideoNav 把稀疏预知与闭环反馈结合,有效缓解了这一问题。
效率账:27 倍端到端加速是如何构成的
摘要里的 27 倍并非单一优化,而是稀疏化与蒸馏两项设计叠加的结果。作者在 teaser 中给出的对照是:推理时间从 21.6 秒降到 0.8 秒(27 倍),第一、二阶段的训练时间从 357 小时降到 49 小时(7.1 倍)。消融实验把这笔账拆得更细:
| 设计维度 | 对照设置 | 结果 |
|---|---|---|
| 稀疏设计 | 连续生成 vs 间隔 3 稀疏生成 | 推理 1.35s → 0.79s,1.7 倍加速 |
| 扩散蒸馏 | 50 步 vs 4 步 | 推理 7.56s → 0.79s,约 10 倍加速,且 4 步画质可比 50 步 |
| 历史压缩 | 有 / 无 Former(历史长度 N=45) | 无 Former 时延迟惩罚 +54.9%;有 Former 则延迟与历史长度解耦,保持稳定 |
| 数据规模 | 8h / 50h / 140h | FVD 2534 → 1755 → 1390,持续下降 |
| 预训练顺序 | 渐进适配 vs 从零直接训第二阶段 | 32h vs 64h 收敛,2 倍训练加速(32 张 H200) |
论文还设计了三组变体来验证稀疏设计的必要性。变体 (a)「蒸馏 4 步 + 连续 2 块」刻意用来模拟 LLM 基线的短视效果,成绩仅 15.8 / 2.5;变体 (b)把连续块数扩到 10,成绩提升到 36.7 / 11.7,说明延长时域确有帮助但并不足够;变体 (c)「不蒸馏 50 步 + 连续 20 块」可以视作精度上限(oracle),成绩为 62.5 / 35.8——它比 SparseVideoNav 的 50.0 / 25.0 更好,但代价是推理速度慢 1.7 倍、训练收敛时间多 1.4 倍,这正是论文所主张的效率与效果之间的合理取舍。变体 (d)去掉 Former 后为 45.0 / 22.5,性能与延迟双双退化。
两个「涌现」现象与诚实的局限
论文第四节讨论了两个颇具启发的现象。其一是动态行人避让。由于 DA3 在存在迎面行人的场景下难以给出可靠的动作估计,作者在数据构造时过滤掉了这类轨迹;然而在部署中,SparseVideoNav 却涌现出动态避让行人的能力——它成功绕开迎面行人并抵达门口。这被作者视为强泛化能力的证据。其二是相机高度不敏感。LLM 范式对相机高度变化相当敏感,而视频生成范式保持了鲁棒性:尽管训练数据采集自约 1 米高度,SparseVideoNav 在相机固定于 50 厘米时依然能完成导航。
局限部分同样写得坦白。作者列出两点:第一,自建的 140 小时数据相比网络级(web-scale)数据仍不算充分,扩大数据规模被视作关键的改进方向;第二,在推理延迟上,尽管做了大量优化以支持真实部署,速度仍略微落后于现有基于 LLM 的导航范式,作者认为面向 VGM 的加速蒸馏与量化是值得探索的下一步。论文同时承认:一次干净的检测通过只能作为证据而非质量证明,真正的视觉质量仍需在多个视口下人工检视。
如果放进更大的坐标系,这篇论文与两条近期脉络形成了有趣的对话。一条是「世界模型做决策」:从 Dreamer 系列到 Genie,学习一个能预测未来的表征再从中提炼动作,一直是梦寐以求的路径;SparseVideoNav 的贡献在于指出,通用视频生成模型本身的先验已经足够强,强到不需要从零学一个世界模型,只需要用少量真实导航数据把它「对准」机器人视角与决策需求。另一条是「视频预训练迁移到机器人」:近年来大量工作在研究如何从互联网视频里蒸馏操作技能,而本文展示的是同一种迁移逻辑在导航这一更强调长时程空间推理的任务上同样成立——甚至更自然,因为导航的未来本质上是第一人称视频的演化。对工程团队而言,还有一个务实的信号:论文中所有加速手段(稀疏监督、flow matching 一致性蒸馏、特征压缩解耦延迟)都是与主干无关的通用技术,可以直接套用到其它以视频生成为底座的具身系统上。
为什么这篇值得读:范式层面的三个提醒
第一,换一个「预训练先验」而不是换一个更大的模型。这篇论文最漂亮的地方在于,它没有去堆规模,而是指出了一个被忽视的错配:BVN 需要长时程视觉预知,而 LLM 的语言预训练里没有这种先验,VGM 天然有。同一个任务,换掉承载预知的模态,比在同一模态里加大监督时域更有效——后者甚至会破坏训练稳定性。
第二,稀疏化不只是省算力,更是能力来源。通常我们把稀疏当作效率手段;这里它同时是延长预测时域的手段。在预测帧数受限的前提下,帧间隔是调节时域长度的旋钮,而间隔 3 是在「看得够远」与「看得够清」之间的最优折中。这是一个很有迁移价值的观察,对任何「用固定长度的未来预测支撑长时程决策」的系统都适用。
第三,工程细节决定成败,且值得写进论文。零初始化的交叉注意力保证了生成先验不被破坏;用 DA3 对生成帧重新打标来解决合成动力学与原始动作标签的错位;用 Former 让延迟与历史长度解耦;甚至连「基线侧身停下而自己正面停下」这种可能造成评测偏差的细节都被显式讨论并用距离定义消解。这些都是把一个漂亮想法真正推到机器人上跑通所必须付出的代价。
SparseVideoNav 由香港大学与 OpenDriveLab 完成,代码与数据承诺开源于 github.com/OpenDriveLab/SparseVideoNav。论文收录于 arXiv:2602.05827(cs.CV,2026 年 2 月 5 日提交),作者为 Hai Zhang、Siqi Liang、Li Chen、Yuxian Li、Yukuan Xu、Yichao Zhong、Fu Zhang、Hongyang Li(前两位为共同第一作者),研究受国家自然科学基金(62206172)与香港赛马会慈善信托基金资助的 JC STEM Lab of Autonomous Intelligent Systems 支持。



