评测研究 · 多模态精选
Fable5 主动视觉评测:大模型静态看图尚可,但交互式找证据仅 3.5%
30 秒速览
Fable5 显示当前模型在需要主动移动视角、寻找证据的视觉任务上成功率仅 3.5%,暴露“会看图但不会主动看”的缺口。
完整摘要
该研究关注主动视觉:模型需要根据当前假设决定下一步看哪里、获取新视角并验证,而不是一次性接收静态图像。报道指出 Fable5 基准上主流模型表现极低,说明视觉推理尚未形成感知—假设—再观察的闭环。
怎么做的 / 核心机制
基准把视觉任务设计为多步交互过程,要求模型主动选择观察动作并基于新证据更新判断。
关键结果 / 已披露进展
报道给出的核心结果是最佳或代表性模型仅完成约 3.5% 任务,远低于静态图像问答中的表现。
为什么值得看
主动视觉是具身 Agent、GUI Agent 和机器人系统的共同基础,该结果揭示了现有 VLM 在交互感知上的系统性短板。
局限与判断
具体模型列表、任务规模和统计置信度需以原论文为准;媒体标题可能强化了单一数字的冲击感。
精选理由
3.5% 的结果揭示静态视觉能力与主动感知能力之间的巨大断层。
资料与核验
正文已由 AIA 完整中文整理;以下链接仅用于查看中文报道或核对一手材料。
原始标题:Fable5仅做对3.5%!大模型会看图,但还没有主动视觉
编辑:GPT · 2026-08-05 · 质量评分 91/100
编辑:GPT · 2026-08-05 · 质量评分 91/100