只用了800小时人类视频数据的人形机器人模型,是更聪明还是太冒险?
先说结论核心优势在于数据效率用人类视频解决“视觉-语义”通用性用少量机器人数据专攻“关节控制”特异性避免了天量遥操作数据的采集成本。架构设计有明确的权衡VLMSystem-2与动作专家System-1解耦牺牲了端到端优化的潜在上限换来了模块化、可解释性和训练稳定性。开源意义大于性能数字作为一个完整开源的全身VLA方案它提供了从数据准备、模型训练到部署含实时分块RTC的全套参考降低了领域入门门槛。从“堆数据”到“巧训练”Ψ0的策略是否能成为人形机器人模型降本增效的可行路径让人形机器人学会像人一样行走并操作物体听上去是终极目标但第一个拦路虎既不是算法也不是硬件而是数据。更准确地说是获取数据的惊人成本。想象一下你需要一个操作员穿着动捕设备在真实环境中一遍又一遍地教机器人完成“走到水池边拧开水龙头拿起杯子接水”这类长链条任务。每一分钟有价值的交互数据背后都是昂贵的人力、精密的设备和巨大的时间损耗。这就是为什么很多机器人研究要么停留在仿真要么只能演示短时程的简单动作。数据成了把人形机器人从实验室推向现实世界的首要瓶颈。Ψ0这篇工作最吸引我的地方不是它最终在八个任务上超越了GR00T或π0.5而是它尝试用一套聪明的“组合拳”来绕过这个成本悬崖。它的核心思路很清晰把问题拆开。第一阶段让模型“看”人怎么做。这里用了约800小时的人类第一视角视频EgoDex数据集。目标不是让模型直接输出机器人的关节角度这根本对不上。目标是让模型学会理解这个视觉世界——什么是“水龙头”什么是“抓握”动作的意图是什么。这本质上是在预训练一个强大的、与物理世界对齐的视觉-语言理解能力。这部分数据虽然也大但获取成本相对低得多网上有大量的人类日常活动视频。第二阶段让模型“学”机器怎么动。在拥有了一个不错的“视觉大脑”之后冻结它。然后用一个全新的模块——基于MM-DiT的动作专家去学习那30小时珍贵的真实机器人交互数据。这时任务变得纯粹给定当前视觉特征和机器人本体状态直接预测未来一段时间内43个关节该怎么运动。因为视觉理解的任务已经交给了上一阶段这个动作专家可以专心攻克机器人本体的运动学和动力学特性。这种“解耦”听起来很美但它也有代价。最大的疑问就是从人类视频中学到的“高层次意图”在迁移到机器人身上时信息损耗有多大论文里的消融实验给了部分答案如果只用预训练好的通用VLM比如Qwen3-VL不经过第一阶段的人类动作预测训练效果很差。这说明仅仅有视觉识别能力不够必须在“预测动作”这个任务上对VLM进行对齐才能学到对操控有用的表征。再看它的三层架构能更清楚地看到这种设计背后的权衡。System-2VLM骨干是冻结的知识库负责从图像和语言指令中提取高级特征。好处是稳定一旦预训练好就可以复用不会在后续训练中发生灾难性遗忘。坏处是它和后续系统的交互是单向的、僵化的如果预训练阶段存在对机器人场景的视觉偏差后面很难纠正。System-1MM-DiT动作专家是专门的控制生成器。采用扩散模型思路目的是生成平滑、多样的动作序列。论文强调它比“朴素DiT”更好因为它的“多模态”设计能让动作token和视觉-语言token在注意力层进行交互。这相当于在生成每一个动作时都能反复“瞥一眼”视觉上下文。但复杂度也上来了5亿参数的动作专家推理延迟是实打实的挑战。System-0RL下肢跟踪器直接用了现成的AMO控制器。这是一个非常务实的做法。把复杂的全身平衡、行走问题用一个经过充分验证的专用控制器搞定上层只需要给出高级指令如“向前走0.2米”。这大大降低了动作专家需要学习的难度但也把系统分割成了两个闭环中间的指令接口如果设计不好会导致行为不连贯。说到推理延迟就引出了一个容易被论文一笔带过、但对实际部署生死攸关的细节实时动作分块RTC。一个几十亿参数的模型思考一次要160毫秒以上。如果机器人每执行一步都停下来等模型“想一想”动作会一卡一卡的像极了网络延迟很高的视频通话。Ψ0采用了“训练时实时分块”的策略。简单说就是在训练动作专家时就模拟推理延迟的情况随机把动作序列的前面一小部分“遮盖”起来告诉模型“这几步已经执行了你别管了接着预测后面的”。这样训练出来的模型在真实部署时就能一边执行当前动作块一边提前计算下一个动作块实现无缝衔接。这个技术点不是Ψ0首创但它能工程化地实现并集成到系统中是它能跑起来的关键否则再好的策略也只是PPT演示。这套方法的可行性还严重依赖于另一半常被忽视的支撑数据采集管道。论文花了相当篇幅介绍他们定制的遥操作框架——用VR头显、腕带、数据手套和腰部脚部追踪器来解耦地采集上半身灵巧操作和下半身移动指令。这套设备组合的目的很明确降低操作难度提高数据质量和采集效率。这提醒我们评估一个机器人模型不能只看模型本身还要看它需要什么样的“燃料”以及获取这种燃料的代价。Ψ0的策略能成立前提是那30小时的机器人数据是“高质量”的。如果采集的数据本身噪声大、不连贯后续训练的效果会大打折扣。所以Ψ0的路径适合谁如果你是一个研究团队或初创公司想快速在真实人形机器人上验证一些复杂的长链条任务但没有海量预算去采集成千上万小时的机器人数据那么Ψ0的范式值得仔细研究。它提供了一条用相对廉价的互联网视频数据小规模高质量本体数据启动的可能性。但如果你追求的是极致的性能上限或者你的任务场景与现有人类视频数据差异极大比如在极端非结构化环境中作业那么堆砌更多、更相关的机器人本体数据进行端到端的精细调优可能仍然是更可靠的路径尽管成本高昂。我更倾向于把Ψ0看作一个出色的“工程蓝图”和“基线系统”。它证明了分阶段训练是一条可行的路开源代码让后来者能站在一个比较高的起点上去改进其中的每一个模块——比如换更强的VLM设计更高效的动作生成器或者集成更优的下肢控制器。它的价值不在于宣告找到了唯一正确的答案而在于展示了一种在现实约束下做取舍和组合的聪明思路。在机器人迈向通用化的漫长道路上这种对“数据效率”和“系统复杂度”的持续权衡会比任何一个单独的SOTA结果更能推动我们前进。最后留一个讨论点如果现在要启动一个人形机器人的新项目在资源有限的情况下你会优先选择Ψ0这种“分阶段、小数据”策略还是更倾向于收集更多机器人本体数据做端到端训练理由是什么