实验分析 · 系统与基础设施

同一模型换个 Agent Harness,Token 成本最多相差 30 倍

机器之心 · 2026-07-31 · 预计阅读 5 分钟

30 秒速览

Composio 团队使用同一个 Kimi K3 模型,对比 Claude Code、Hermes 和 Kimi Code 等 Agent harness 的执

完整摘要

Composio 团队使用同一个 Kimi K3 模型,对比 Claude Code、Hermes 和 Kimi Code 等 Agent harness 的执行开销。结果显示,框架设计会显著改变上下文组织、工具调用和 Token 消耗,极端情况下成本相差约 30 倍。

怎么做的 / 核心机制

固定底层模型为 Kimi K3,在 Claude Code、Hermes、Kimi Code 等不同 Agent harness 中运行任务,对比上下文组织、工具调用循环和 Token 消耗。

关键结果 / 已披露进展

同一模型在不同框架中的 Token 成本最高相差约 30 倍,说明 Agent 成本很大一部分来自 harness,而不是模型单价本身。

为什么值得看

Agent 的实际成本不能只由底层模型价格解释。Harness 如何维护上下文、反馈工具结果和安排循环,可能比模型选择本身更影响延迟与费用。

局限与判断

结果依赖任务集、配置和具体实现,未必能直接外推到所有模型。更低 Token 消耗也可能牺牲任务成功率,因此必须结合成功率、延迟和质量一起看。

Agent HarnessToken成本系统Claude Code推理效率
原始标题:Claude Code到底有多费token?对比实验来了:三大框架最多差30倍
编辑:GPT · 2026-08-02 · 质量评分 87/100