研究论文 · 具身智能精选震惊瘫坐
TurboVLA 绕开 LLM 中枢:0.2B 参数在 RTX 4090 上实现 32Hz 机器人动作预测
30 秒速览
TurboVLA 将传统 V→L→A 改为视觉和语言直接交互后预测动作,0.2B 参数、0.9GB 显存,在 LIBERO 达到 97.7%。
完整摘要
TurboVLA 质疑 VLA 必须让视觉信息先经过大型语言模型再生成动作的主流结构。它独立编码视觉和语言,通过轻量双向交互形成任务条件表征,再用紧凑解码器输出连续动作块,从而显著压缩参数、显存和延迟。
怎么做的 / 核心机制
架构从传统 V→L→A 改为 V+L→A:视觉和语言分别编码,经过轻量双向交互融合,随后直接解码动作 chunk,不再在每次策略调用时运行大型 LLM 主干。
关键结果 / 已披露进展
论文报告 LIBERO 平均成功率 97.7%,模型仅 0.2B 参数;RTX 4090 上推理延迟 31.2ms、约 32Hz,推理显存 0.9GB。
为什么值得看
它直接挑战“LLM 必须处在 VLA 中央”的架构假设,为消费级 GPU 上实时具身控制提供了更高效路线。
局限与判断
结果集中在 LIBERO 仿真任务;真实机器人、多相机、长时序误差积累和开放环境泛化仍需验证,且与大型 VLA 的任务覆盖面未必相同。
精选理由
方法简单清晰、数字完整,并对 VLA 架构和实时部署提出可验证替代路线。
为什么进入「震惊瘫坐」
0.2B 参数和不足 1GB 显存达到 32Hz,并在 LIBERO 报告 97.7% 成功率,显著改变实时 VLA 的资源边界。
资料与核验
正文已由 AIA 完整中文整理;以下链接仅用于查看中文报道或核对一手材料。
原始标题:VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测
编辑:GPT · 2026-08-03 · 质量评分 95/100
编辑:GPT · 2026-08-03 · 质量评分 95/100