1990–2026 · 五条技术脉络 · 33 个里程碑
61 篇站内收录论文 · 四条谱系 · 分类依据 arXiv:2605.12090
ARX Robotics 展示 GPT-6 Astra 在新房间里理解指令并完成洗衣机旋钮操作。
VLAct在固定机器人数据预算下做多具身表征中心持续预训练,让视觉与动作知识跨机体复用,提升仿真、实机与未见具身迁移表现。
OpenBMB MiniCPM-Robot 1.5B 模型在机械臂操作上超越 2-5 倍参数模型,可感知、决策并执行动作。
Coupled Local and Global World Models 用轻量本地模型算梯度,在全局世界模型中训练 G1 接触操作并零样本部署。
开源视频世界模型 SolarWM 让 Minimax H3 实时生成可交互世界,可持续生成超过一小时,并开放大规模数据与训练流程。
逐际动力 Oli 人形与 TRON 2 多形态机器人零样本部署开源视觉语言导航模型 LightNav-0,实现人物跟随与按指令找物。
Runway GWM Worlds 2 将高保真视频与音频生成扩展为实时交互模拟,用户可定义环境、主体、视觉风格、物理规则和氛围。
Sentdex 试问未经机器人训练的开源多模态大模型,能否承担 VLA 与世界动作模型尝试解决的高层机器人智能,让模型理解目标而不只是模仿动作。
HINT 只在任务模式切换时调用高层语义推理,再用多视角接地与视觉跟踪,把最初的简单意图持续传给 VLA 动作策略,减少视觉相关性导致的意图漂移。
VideoDeltaNet 在 MiniMax H3 上实现近乎无损的混合注意力:局部 softmax 保细节,线性注意力管长程,8 张 B200 上 11.23 秒生成 14.4 秒 768p 视频,可连续流式输出,权重开放。
SolarWM 宣布完全开源,把世界模型研究的端到端流程全部放出:原始数据整理、标注与过滤,训练与推理管线,以及预训练权重,目标是提供真正可复现的长时程视频世界模型基础设施。
把 Unitree G1 放上普通办公椅,仅靠本体感知与速度指令用脚驱动椅子移动;椅子无电机、部署时无接触感知,sim-to-real 零样本成功,说明人形运动能力可泛化到新载具。