最近在关注具身智能领域的朋友可能已经注意到一个现象过去几个月围绕“具身智能”的讨论开始从“需要多少传感器”“机械臂如何控制”这类硬件问题逐渐转向“如何让智能体理解任务”“如何规划行动序列”这类认知层面的挑战。这背后其实是一个关键变化具身智能正在从“感知-行动”的简单闭环走向“感知-理解-规划-行动”的复杂决策链。而清华团队最近提出的 Harness VLAVision-Language-Action框架正是这个转变中的一个重要节点。它最引人注目的主张是具身智能可能正在进入“token 时代”。这里的“token”不是指代币或者认证令牌而是指大语言模型处理信息的基本单位——文本片段。这个判断背后其实是对具身智能核心瓶颈的一次重新定位。1. 为什么具身智能的瓶颈从“硬件”转移到了“理解”具身智能Embodied AI的终极目标是让智能体能够像人一样在物理环境中通过感知、决策和行动来完成复杂任务。早期的研究重点确实集中在硬件层面需要多少摄像头力反馈传感器怎么装机械臂的精度要达到多少这些当然重要但实践中发现即使硬件达标智能体依然经常“卡住”。问题出在任务理解环节。比如让一个机械臂“把桌上的苹果放进篮子里”人类能瞬间理解“桌上”“苹果”“篮子”“放进”这些概念的空间关系和动作含义但传统方法需要分别处理视觉识别、物体定位、路径规划、抓取策略等模块每个模块都可能出错而且模块之间的信息传递容易丢失上下文。Harness VLA 的思路是与其把视觉、语言、动作切成三个孤立的系统不如用一个统一框架来处理。这个框架的核心是把视觉信息、语言指令和动作序列都映射到同一个“token 空间”里。也就是说摄像头看到的图像、人类发出的指令、机械臂要执行的动作全部被转换成一种中间表示——token 序列。这样做的好处是大语言模型在文本领域已经练就的强大的推理和规划能力可以直接迁移到物理任务中。2. Harness VLA 如何用 token 统一表示视觉、语言和动作Harness VLA 的框架设计遵循一个原则最大化复用现有大语言模型的能力。具体来说它包含三个关键组件2.1 视觉编码器从像素到 token传统方法中视觉信息通常被处理成边界框、物体标签或特征向量这些表示会丢失大量细节和上下文。Harness VLA 采用视觉编码器例如基于 ViT 的模型将图像分割成 patch每个 patch 被映射成一个 token。这样一幅图像不再是一堆像素而是一个 token 序列每个 token 携带了局部视觉信息。更重要的是这些视觉 token 可以与语言 token 在同一个序列中混合排列。例如指令“拿起红色积木”中的“红色积木”token可以直接与图像中对应区域的视觉 token 对齐模型就能知道“红色积木”在图像中的具体位置。2.2 语言作为任务规划器在 Harness VLA 中语言指令不再只是触发条件而是任务规划的核心输入。模型会根据指令生成一个动作 token 序列每个 token 对应一个原子动作比如“移动至坐标(x,y,z)”“闭合夹爪”“等待”。这些动作 token 不是预先定义的固定集合而是根据任务动态生成的类似大语言模型生成文本的过程。这样做的好处是模型可以处理非常开放的任务。例如指令“把散落的积木搭成一座桥”模型需要先理解“桥”的结构再规划抓取哪些积木、以什么顺序摆放。这些步骤都可以通过 token 序列来表征。2.3 动作解码器从 token 到控制信号动作 token 序列需要被转换成具体的电机控制指令。Harness VLA 的动作解码器负责这一步它把每个动作 token 映射成机器人关节角度、末端执行器位姿或速度等底层控制信号。由于动作 token 本身携带了语义信息比如“缓慢放置”解码器可以调整动作的力度、速度实现更精细的控制。3. “Token 化”如何改变具身智能的开发范式Harness VLA 提出的 token 统一表示其实是在模仿人类处理任务的方式。人类不会在脑子里分别运行视觉模块、语言模块和动作模块而是用一个统一的大脑皮层来处理多模态信息。这种范式变迁体现在几个方面3.1 数据效率的提升传统方法需要为每个任务收集大量标注数据如图像-边界框-动作序列的对应关系。而在 token 框架下模型可以通过语言指令泛化到新任务。例如只要模型理解“放置”和“抓取”的含义就可以组合出“把A放到B上”这类新指令无需重新收集数据。3.2 任务可组合性Token 序列的本质是序列生成这意味着复杂任务可以被分解成子任务序列。模型可以先生成高层规划“先导航到厨房再打开冰箱”再逐步细化为具体动作“左转30度前进2米”。这种层次化规划能力是传统闭环控制方法难以实现的。3.3 利用外部知识由于任务规划是在 token 空间进行的模型可以直接利用预训练语言模型中的常识知识。例如指令“煮一杯咖啡”模型可以调用“咖啡需要用水”“咖啡机需要插电”等常识自动补全检查水源、电源等步骤。4. 当前局限与落地挑战尽管 Harness VLA 在理念上很有吸引力但落地时仍有几个关键挑战4.1 token 序列的长度限制大语言模型通常有上下文长度限制如 4K 或 8K token。对于长周期任务视觉 token 和动作 token 可能超过限制。需要设计更高效的 token 压缩或记忆机制。4.2 仿真到真实的迁移目前大多数 VLA 模型主要在仿真环境中训练如 AI2-THOR、Habitat。仿真环境与真实世界的差异光照、纹理、物理参数会导致性能下降。如何提高迁移鲁棒性是一个开放问题。4.3 安全性与可靠性Token 序列生成是概率性的可能产生不合理或危险的动作。在家庭、工厂等真实场景中需要引入安全约束机制例如动作验证、紧急停止、人工干预接口。4.4 计算成本实时生成 token 序列对算力要求较高。在嵌入式设备上部署需要模型轻量化、推理优化等技术。5. 给开发者和研究者的实践建议如果你正在探索具身智能或 VLA 方向以下建议可能有助于少走弯路5.1 先从高层次任务规划入手不必一开始就追求端到端的控制精度。可以先用 VLA 模型生成高层次动作序列如“拿起-移动-放置”再用传统控制方法执行。这样既能验证规划能力又降低了实现复杂度。5.2 重视仿真环境建设选择支持多模态交互的仿真平台如 NVIDIA Isaac Sim、Microsoft AirSim并建立任务评估基准。仿真环境能快速迭代算法大幅降低数据收集成本。5.3 关注 token 效率设计 token 化方案时平衡信息密度与计算开销。例如动态调整视觉 token 的分辨率任务相关区域高分辨率背景低分辨率或对动作 token 进行分层编码粗粒度动作细粒度调整。5.4 建立可解释性工具Token 序列是黑箱生成需要可视化工具来理解模型的决策过程。例如可视化视觉 token 的注意力图、动作 token 的时序依赖关系帮助调试和优化。Harness VLA 代表的 token 化范式正在让具身智能从“硬编码”走向“生成式”。这不仅是技术路线的变化更意味着智能体可以处理更开放、更复杂的任务。虽然目前还存在诸多挑战但这个方向已经显示出足够的潜力——当我们用同一套“语言”来描述感知、思考和行动时智能体才能真正理解我们在说什么并做出符合预期的反应。