方法复盘 · 具身智能

VLA 位置指令研究:显式语言对齐让泛化能力提升 20%–40%

机器之心 · 2026-08-06 · 预计阅读 6 分钟

30 秒速览

研究针对 VLA 对改写指令敏感的问题,引入更明确的位置语言对齐,在多项设置中把指令泛化提升约 20%–40%。

完整摘要

一项 VLA 研究指出,语言模块并非可有可无:许多机器人策略在训练和测试指令措辞一致时表现良好,但换一种位置表达就会显著退化。团队通过强化位置概念与动作空间的显式对齐,改善对同义改写和空间关系变化的泛化。

怎么做的 / 核心机制

方法把自然语言中的位置关系映射到更稳定的空间表示,并在视觉、语言和动作之间建立对齐约束,使策略不只记忆训练指令表面形式。

关键结果 / 已披露进展

报道给出的结果显示,在若干 VLA 指令泛化设置中,性能提升约 20%–40%,尤其缓解简单改写导致的成功率骤降。

为什么值得看

它直接回应了 VLA 中语言是否真正发挥作用的争议,并指出具身模型的语言模块应承担可验证的空间泛化功能。

局限与判断

具体提升依赖数据集、基线和指令改写方式;尚需核对原论文完整表格、真实机器人实验和跨平台泛化,不能把区间直接外推到所有 VLA。

VLA指令泛化空间语言机器人语言对齐

资料与核验

正文已由 AIA 完整中文整理;以下链接仅用于查看中文报道或核对一手材料。

原始标题:反击VLA中「L」无用论:用对位置指令泛化能力暴涨20-40%
编辑:GPT · 2026-08-06 · 质量评分 86/100