VLA 的困难并不只在模型容量,而在可用数据和控制数据之间存在巨大鸿沟:网络视频没有机器人动作,合成轨迹缺少真实接触,强推理模型又往往达不到控制频率。本篇以这三类矛盾为线索,判断八项工作分别把复杂度转移到了哪里。
UniVLA
UniVLA 从相邻画面的任务相关变化中学习潜动作,使公开视频可以在没有关节命令的情况下参与预训练。接入目标机器人时,再由本体专用解码器把共享潜变量翻译成真实控制量。

GraspVLA
GraspVLA 依靠大规模合成动作数据建立对象、语言目标和抓取动作之间的对应,再用真实数据完成策略校准。这条路线把稀缺的真机采集从“学习全部能力”转为“修正仿真偏差”。

A0
A0 将高层可供性判断与低层动作生成分开。前者确定当前阶段及操作区域,后者只在收缩后的空间中控制,从而避免一个端到端策略同时承担开放语义和高精度运动。

OneTwoVLA
OneTwoVLA 为策略提供快慢两条路径:熟悉且确定的状态直接产生动作,歧义场景或长程决策才启用更完整的推理。它把计算量变成按需资源,而不是每一步固定支付。

Magma
Magma 用 set-of-mark 标出可交互实体,再以 trace-of-mark 表达随时间变化的运动,使 UI 操作、导航和机器人控制共享一套视觉指代接口。显式标记降低了语言描述空间位置的歧义。

CoT-VLA
CoT-VLA 在动作之前生成带空间信息的视觉中间状态,让推理不仅存在于文字中,也保留对象位置与运动线索。中间结果因而可以被观察,但仍需证明它参与了动作决策。

Interleave-VLA
Interleave-VLA 允许图像证据与语言条件在执行序列中多次交替出现,因此操作者可以中途补充目标,策略也能在阶段边界读取新的场景状态,而不必把长任务压缩成单次输入。

SmolVLA
SmolVLA 从低成本设备的约束出发,将紧凑视觉语言模型、异步推理和动作解码共同设计。目标不是单纯压缩参数,而是让感知推理与机器人控制在有限算力上持续并行。

| 工程矛盾 | 对应方法 | 建议优先验证 |
|---|---|---|
| 视频多、动作少 | UniVLA / GraspVLA | 潜动作可执行性与仿真偏差 |
| 语义慢、控制快 | A0 / OneTwoVLA | 切换错误与恢复机制 |
| 语言空间歧义 | Magma / CoT-VLA | 实体身份与中间状态因果性 |
| 长上下文与边缘算力 | Interleave-VLA / SmolVLA | 信息淘汰与尾延迟 |