← 返回视频TOPReward 零训练机器人奖励模型视频加载中视频加载中收藏分享直接从预训练 VLM 的 token 概率读取内部信念作为奖励信号,无需训练或微调,适配开源模型。视觉语言动作模型Reward Model视觉语言模型ZeroTrainingTOPRewardOpenSource零训练开源Category: researchAuthor: @IlirAliu_Date: 2026-07-26T00:00:00Duration: 69.3sSource: https://x.com/IlirAliu_/status/2081376433474097413