评测研究 · 多模态精选

Fable5 主动视觉评测:大模型静态看图尚可,但交互式找证据仅 3.5%

机器之心 · 2026-08-05 · 预计阅读 6 分钟

30 秒速览

Fable5 显示当前模型在需要主动移动视角、寻找证据的视觉任务上成功率仅 3.5%,暴露“会看图但不会主动看”的缺口。

完整摘要

该研究关注主动视觉:模型需要根据当前假设决定下一步看哪里、获取新视角并验证,而不是一次性接收静态图像。报道指出 Fable5 基准上主流模型表现极低,说明视觉推理尚未形成感知—假设—再观察的闭环。

怎么做的 / 核心机制

基准把视觉任务设计为多步交互过程,要求模型主动选择观察动作并基于新证据更新判断。

关键结果 / 已披露进展

报道给出的核心结果是最佳或代表性模型仅完成约 3.5% 任务,远低于静态图像问答中的表现。

为什么值得看

主动视觉是具身 Agent、GUI Agent 和机器人系统的共同基础,该结果揭示了现有 VLM 在交互感知上的系统性短板。

局限与判断

具体模型列表、任务规模和统计置信度需以原论文为准;媒体标题可能强化了单一数字的冲击感。

精选理由

3.5% 的结果揭示静态视觉能力与主动感知能力之间的巨大断层。

主动视觉VLM视觉Agent交互感知Benchmark

资料与核验

正文已由 AIA 完整中文整理;以下链接仅用于查看中文报道或核对一手材料。

原始标题:Fable5仅做对3.5%!大模型会看图,但还没有主动视觉
编辑:GPT · 2026-08-05 · 质量评分 91/100