
LT-Mem 精读:波动感知的时空记忆——让机器人记住「那把绿椅子都去过哪」
DGIST(韩国大邱科学技术院)团队,IROS 2026 接收。长期作业的机器人反复重访同一环境,现有系统要么覆写历史保最新地图、要么存语义快照却没有跨会话对象身份——作者称之为「时间性失忆」:无法回答「那把绿椅子在所有会话里都去过哪?」。LT-Mem 三层解法:① 感知层:MASt3R-SLAM 多会话对齐(Sim(3) 锚点+跨会话回环+g2o 联合优化)+SAM3 实例分割提取每个对象的质心/体积/视觉嵌入;② 推理层:五项证据评分(E1 空间接近、E2 时间连续、E3 特征相似(主信号 w=0.45)、E4 运动一致性、E5 遮挡处理)做确定性跨会话重识别,仅歧义案例交给受限 LLM 判 MATCH/NEW-TRACK/HOLD;结构完整性检查对齐失败则整会话 HOLD;波动分数 V 用贝叶斯式证据累积(Eq.2,LLM 只给一次先验),据此在 OVERWRITE/HOLD/MULTI-HYPOTHESIS 三种更新间选择;③ Tri-Memory:Live 存当前状态、Delta 记带时间戳事件日志(APPEAR/DISAPPEAR/MOVE/RE-APPEAR/NONE)、Meta 累积波动统计并反馈回更新策略。发布 LT-VQA 数据集(两个室内环境各 10 对象×10 会话+室外停车场 10 会话,61 个状态变化事件+80 组 QA)。结果:Event F1 0.910 / QA-Event 0.820 / QA-Freq 0.600 全面超 Geometric/Text-Batch/VLM-Batch/STAR 四基线,token 消耗 438K 仅为 VLM-Batch(7,114K)的 1/16、STAR(45,859K)的 1/100;换 Qwen2.5-3B 仍达 0.885,证明增益来自结构化记忆架构而非 LLM 能力。消融:去掉重识别 F1 崩至 0.140,去掉波动感知降至 0.615。停车场景景级统计还能答「什么时候去最好找车位」(8:00 AM 0 辆 vs 1:03 PM 34 辆)。