学术发现 · 多模态

视觉 Agent 不该逢题必调工具:Beacon 学习何时调用、调用什么

Hugging Face Daily Papers · 2026-07-29 · 预计阅读 6 分钟

30 秒速览

Beacon 从两个维度重新审视视觉 Agent 的工具使用:模型能否识别何时真的需要工具,以及调用工具后是否真正改善结果。目标是避免为了展示 Agent 流程

完整摘要

Beacon 从两个维度重新审视视觉 Agent 的工具使用:模型能否识别何时真的需要工具,以及调用工具后是否真正改善结果。目标是避免为了展示 Agent 流程而无差别地增加调用步骤和计算开销。

怎么做的 / 核心机制

把视觉 Agent 的工具使用拆成两层决策:先判断当前问题是否真的需要工具,再选择具体工具;调用后则检查工具是否实际提升了答案,而不是只统计调用次数。

关键结果 / 已披露进展

核心结论是“会调用工具”不等于更强,选择性调用能减少无效链路、计算和误差。当前公开摘要没有列出所有基准上的具体增益,因此更适合视为评测与路由思路。

为什么值得看

很多 Agent 工作把“会调用工具”本身当作能力,但真正有价值的是选择性调用并带来可测收益。这项工作把工具使用从形式上的复杂轨迹拉回到任务成功率和成本。

局限与判断

效果会依赖工具库、路由监督和任务分布。面对新工具、失效工具或开放环境时,“何时调用”的判断可能明显退化。

视觉推理Agent工具使用多模态效率
原始标题:Beacon: Knowing When and How to Perform Agentic Visual Reasoning
编辑:GPT · 2026-08-02 · 质量评分 84/100