ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

VLA中语言模块不是装饰:位置指令泛化提升20-40%的关键方法

2026/8/28 1:32:30 拓冰建站 浏览量
VLA中语言模块不是装饰:位置指令泛化提升20-40%的关键方法 VLAVision-Language-Action视觉-语言-动作模型最近热度很高但一个让很多团队不太舒服的现象也越来越多训练时指令听得好好的把“把苹果放到左边的盘子里”换成“请将苹果放置于左侧的那个盘子中”成功率掉一截换一个新场景、新视角模型开始答非所问甚至有人把语言分支的输入换成随机 token任务居然还能完成。于是社区里出现了一个争论VLA 里的“L”也就是语言模块到底是不是装饰品这个争论有它的观察基础但我想给一个更准确的判断L 没有被证明无用而是“位置指令”这个最关键的维度被用错了。指令里真正难处理的不是“苹果”“杯子”这类语义名词而是“左边”“上面”“旁边”这类空间关系词。很多模型并没有真正理解位置词与视觉空间的对应关系只是记住了训练数据里的共现模式。一旦按位置指令的结构化解析、视觉-语言空间对齐、相对坐标建模这几个方向把“L”用对指令泛化能力在标准评测场景里可以提升 20-40% 的量级。这篇文章会从“L 无用论”的现象出发拆解位置指令为什么会成为 VLA 泛化的天花板并给出一套从数据构造、模型设计到评估验证的最小实现路径。即使你当前用的不是所谓“最新最强”的 VLA 框架这里说的设计思路也完全可以迁移到自己的模型上。1. “L无用论”到底是怎么出现的1.1 三个容易被观察到的现象先说现象。在 VLA 的早期验证里很多团队都会做一个消融实验把语言编码器从网络中去掉只保留视觉特征和动作输出然后重新训练对比任务成功率。结果往往让人尴尬——在一些固定任务上没有语言分支的模型成功率并没有明显下降个别简单任务甚至持平。第二个现象出现在指令改写测试。把“把苹果放到左边的盘子里”改成“请将苹果放置于左侧的那个盘子中”语义完全相同但模型成功率会掉一截。这说明模型对指令的理解停留在表层模式匹配而不是真正的语义理解。第三个现象最致命把语言分支的输入换成随机 token部分模型仍然能够完成训练集中常见的操作。这说明在模型内部动作决策实际上主要依赖了视觉上下文语言指令只是“锦上添花”的弱条件。三个现象叠加“L 无用论”就有了市场。1.2 现象背后的共同点如果把这三种现象放在一起看会发现它们指向同一个结论语言指令并没有真正参与动作决策。或者说语言特征被压缩到了几乎没有信息量的程度。问题出在大多数 VLA 对语言特征的处理方式上。主流做法是先用一个预训练语言编码器把指令编码成句子级特征向量再与视觉特征做融合。但句子级特征经过平均池化之后语义名词的信息还在空间关系词的信息却被稀释得所剩无几。换句话说模型知道指令里提到了“