免责声明本文仅为学术交流目的翻译自外文文献翻译内容可能存在不准确之处仅供参考学习。版权归原作者及原出版方所有如有侵权请联系删除。原文链接https://arxiv.org/abs/2505.21432code链接https://github.com/hume-vla/humeHume为视觉 - 语言 - 动作模型引入第二系统的思维简介Hume模型一款融合价值引导的思维与级联动作去噪第二系统的双系统VLA模型第二系统通过为视觉 - 语言 - 动作模型骨干网络扩展全新的价值查询头来估计预测动作的状态 - 动作价值从而实现价值引导的思维过程该过程通过重复采样多个动作候选集并依据状态 - 动作价值筛选最优动作完成。Hume模型的第一系统是一个轻量级的反应式视觉运动策略它接收第二系统筛选的动作并执行级联动作去噪以完成机器人灵巧控制。在部署阶段第二系统以低频率执行价值引导的思维推理而第一系统异步接收第二系统选定的动作候选集实时预测流畅的机器人动作。hume模型结构价值引导的第二系统思维Hume的第二系统是基于预训练视觉 - 语言模型构建的视觉 - 语言 - 动作模型其输入包括 t 时刻的 RGB 图像、自然语言指令和机器人状态信息​。与传统视觉 - 语言 - 动作模型类似我们首先为视觉 - 语言模型骨干网络添加动作去噪头学习映射函数从观测信息生成机器人候选动作​即。此外为赋予hume模型第二系统思维能力我们为视觉 - 语言模型骨干网络添加另一价值查询头用于估计候选机器人动作的状态 - 动作价值。候选动作生成机器人候选动作由动作去噪头生成该模块旨在建模数据分布其中包含图像​、语言指令和机器人状态。动作去噪头基于 Transformer 实现流匹配去噪过程用于预测 “含噪动作”中剩余的动作噪声其中为流匹配时间步代表动作的噪声水平。从随机噪声出发去噪头通过前向欧拉法逐步去除噪声从生成公式为其中为去噪步长实验中设置 10 个去噪步长对应。训练阶段从数据集中采样真实动作将含噪动作和观测作为输入通过最小化实际剩余噪声与网络输出的损失优化去噪头。训练完成后在t时刻基于相同的观测动作去噪头通过分别从积分至的学习向量场生成 N 个不同噪声水平的候选机器人动作块公式为其中用于控制相邻候选动作间的噪声间隔为从正态分布采样的初始动作。需注意生成的大部分候选动作并未完全去噪。状态 - 动作价值估计状态 - 动作价值由价值查询头估计该模块基于同一视觉 - 语言模型骨干网络构建通过学习隐式条件Q函数实现。价值查询头包含两个估计状态 - 动作价值的评判网络以及一个辅助评判网络训练的动作网络。具体而言我们在视觉 - 语言模型输入序列的末尾添加一个专用的查询令牌该令牌为可学习令牌与语言令牌的嵌入维度一致。对于任一动作块无论是真实动作还是候选动作将其与该查询令牌结合后输入价值查询头。由于查询令牌位于输入序列最后一位它会关注所有前置令牌并从视觉 - 语言模型的输入t 时刻的 RGB 图像、自然语言指令中聚合必要信息从而基于输入查询令牌估计动作块​的状态 - 动作价值。价值引导的思维推理Hume模型的第二系统价值引导思维通过N最优的选择策略实现选定的动作块将被传递至第一系统执行级联动作去噪。具体而言基于同一观测动作去噪头生成 N 个不同噪声水平的候选动作块并将这些候选块输入价值查询头估计状态 - 动作价值在价值估计的引导下选择价值最高的动作作为最优候选块​传递至第一系统公式为级联双系统动作去噪为实现快速、反应式的机器人控制第一系统需满足轻量级和快速推理的要求。具体而言第一系统由 DINOv2-small 视觉编码器和用于级联动作去噪的轻量级 Transformer 构成接收第二系统选定的候选动作块、观测包含当前图像和机器人状态以及从选定候选块中截取的子动作块作为输入通过对子动作块持续去噪生成精细化的机器人动作。在 t 时刻第二系统选定的动作块为将其切分为 K 个时程为 h 的子动作块其中K:H/h第一系统结合观测对这些子动作块依次执行级联去噪。需注意第一系统的推理速度远快于第二系统因此能在接收到下一个动作块​前完成所有子动作块的级联去噪。第一系统采用与第二系统动作去噪头相同的流匹配损失训练损失函数为其中上标ω代表第一系统的流匹配时间步。需注意第二系统生成的候选动作块并未完全去噪即​需要通过持续去噪实现精准的动作预测。第一系统通过从ω0积分至ω1的学习向量场对动作进行精细化处理与从随机噪声开始的去噪不同第一系统的积分过程从子动作块开始公式为其中为第一系统学习的向量场。采用前向欧拉法设置 10 个去噪步长对应第一系统生成最终的去噪动作。当第一系统完成所有 K 个子动作块的处理后第二系统将生成新的选定动作块第一系统继续对新动作块的片段进行精细化处理。训练与部署策略hume模型的训练分为两个阶段1.第一阶段首先训练第二系统的视觉 - 语言模型骨干网络和动作去噪头采用流匹配损失确保第二系统能预测可靠的动作2.第二阶段冻结第二系统的视觉 - 语言模型骨干网络和动作去噪头从头训练第一系统和第二系统的价值查询头。价值查询头的训练目标为最小化带正则项的Bellman误差公式为其中为校准保守正则项用于防止 Q 值高估定义为为应用于延迟目标 Q 网络的备份算子。推理阶段第一、二系统通过异步机制协作提升整体控制频率具体流程为1.初始时刻 t第二系统的动作去噪头以 4Hz 的频率生成 N5 个时程 H30 的候选动作块选定的最优动作候选块存入共享队列2.从​的前 h 步截取时程 h15 的子动作块​传入第一系统3.第一系统去除中的剩余噪声以 6Hz 的频率生成完全去噪的动作并立即在真实机器人上执行全部 h15 个动作最终实现 90Hz 的机器人动作控制频率4.当机器人执行完中所有 KH/h2 个子动作块后第一系统从共享队列中获取最新的选定动作块继续执行动作去噪。依托第一、二系统的不同工作频率二者异步协作实现了类人慢思维与机器人快速反应式实时控制的平衡。结论与局限性Hume模型一款探索类人思维能力的双系统视觉 - 语言 - 动作模型适用于通用机器人策略。休谟通过基于状态 - 动作价值估计的 N 选优策略实现价值引导的第二系统思维并通过所提级联动作去噪融合第一、二系统实现灵巧任务的快速、流畅控制。通过仿真和真实机器人平台的大量实验验证了Hume模型优于当前 sota 模型在各类机器人任务中均展现出优越性尤其在复杂任务的部署过程中出现失败时表现出良好的恢复能力为通用机器人策略的研究提供了极具前景的方向。局限性1.价值引导的第二系统思维受限于采样候选动作块的质量如何在采样候选集中纳入更多高价值候选动作是值得探讨的问题。2.估计的状态 - 动作价值与语义的对齐性不足如何实现更优的价值学习仍是未来的研究方向3.Hume所实现的第二系统思维范式仍相对基础未来可探索更复杂的范式如树搜索、自校正、强化学习方法等。