第三方评测更新 · Agent

Qwen3.8-Max Agentic Index 更新:Artificial Analysis 报告 55.4 分并升至榜首

量子位 · 2026-08-06 · 预计阅读 5 分钟

30 秒速览

Artificial Analysis 新一期 Agentic Index 中,Qwen3.8-Max 获 55.4 分并位列第一;这是模型发布后的独立榜单更新。

完整摘要

量子位援引 Artificial Analysis 最新榜单称,阿里 Qwen3.8-Max 在 Agentic Index 中获得 55.4 分,超过同期 Claude Opus 5 与 GPT-5.6,升至榜首。该指数试图综合衡量模型在工具调用、复杂任务执行与多步 Agent 场景中的能力。此条作为 Qwen3.8-Max 正式发布后的评测更新单独收录,并链接此前的模型发布卡片。

怎么做的 / 核心机制

Artificial Analysis 的 Agentic Index 汇总多个面向工具使用和多步任务执行的 Agent 基准,以统一评分形成模型横向比较。此次报道披露的是更新后的综合分数与排名,而非单一厂商自测结果。

关键结果 / 已披露进展

报道给出的核心结果是 Qwen3.8-Max 获得 55.4 分并排名第一;此前中国模型的最好成绩被描述为 Kimi K3 的 50.1 分。该结果为 Qwen3.8-Max 发布时披露的 Agent 能力提供了新的第三方榜单信号。

为什么值得看

Qwen3.8-Max 已有完整模型发布卡片,而第三方 Agent 榜单的后续结果提供了新的可比较数字。对选择闭源 API、搭建工具型 Agent 和评估国产模型竞争力的开发者,这一更新具有直接参考价值。

局限与判断

量子位文章为阿里巴巴授权转载,仍带有明显厂商传播属性;综合指数会受任务集合、工具环境、提示模板、重试策略和版本更新影响,不能等同于所有真实 Agent 工作负载中的全面领先。应结合榜单方法说明和逐项成绩解读。

Qwen3.8-MaxAgentic IndexArtificial Analysis工具调用Agent评测第三方基准

资料与核验

正文已由 AIA 完整中文整理;以下链接仅用于查看中文报道或核对一手材料。

原始标题:Artificial Analysis榜单:阿里Qwen3.8Agentic能力得分全球第一
编辑:GPT · 2026-08-06 · 质量评分 86/100