PAPER DEEP DIVE
GR00T N1: NVIDIA 人形机器人基础模型
GR00T N1 是 NVIDIA 发布的人形机器人基础模型,结合视觉-语言理解和动作生成,支持跨平台迁移和人形机器人通用技能学习。
GR00T N1 是 NVIDIA 发布的人形机器人基础模型,结合视觉-语言理解和动作生成,支持跨平台迁移和人形机器人通用技能学习。
PAPER DEEP DIVE
GR00T N1 是 NVIDIA 发布的人形机器人基础模型,结合视觉-语言理解和动作生成,支持跨平台迁移和人形机器人通用技能学习。
GR00T N1 是 NVIDIA 发布的人形机器人基础模型,结合视觉-语言理解和动作生成,支持跨平台迁移和人形机器人通用技能学习。

SoL-Pi 将智能体执行框架改进转化为规模化自主研究,筛选出四项可复用效率机制,在性能接近基线时将令牌流量降低 44.7% 至 49.0%。

NVIDIA 用分而治之的加速策略把 FoundationStereo 拆成特征提取、代价滤波、视差精化三段各自提速:知识蒸馏压缩混合骨干、块级神经架构搜索在延迟预算内自动配出代价滤波网络、结构化剪枝精简迭代精化模块,再用 140 万对自动伪标注的真实立体图像补训。模型比 FoundationStereo 快 10 倍以上,零样本精度几乎追平,在 Middlebury/ETH3D/KITTI 上是实时立体匹配的新 SOTA。

视觉-语言-动作(VLA)模型在机器人操作领域前景广阔,但实际部署受制于高推理延迟与不稳定的异步执行——在基于流匹配(flow-matching)的 VLA 模型中尤为突出:动作解码需要在 VLM 上下文条件下进行多步迭代。高效推理方法能提升控制频率,异步方法能减少执行空等,但现有方案往往无法同时兼顾低延迟推理与精确、时序一致的异步执行。FlashVLA 提出一个统一的流式动作解码框架:维护一个包含多个不同噪声水平动作块的流式缓冲区,并用块级因果注意力(chunk-wise causal attention)解码,每个推理步即可产出一个可执行动作块;块级自回归结构隐式保持动作连续性,无需额外的未来状态条件即可平滑异步执行。大量仿真与真机实验表明,FlashVLA 在保持强任务性能的同时大幅提升推理速度,单 GPU 即可达到 ≥30Hz 控制频率并实现平滑异步真机部署。