实验分析 · 系统与基础设施
同一模型换个 Agent Harness,Token 成本最多相差 30 倍
30 秒速览
Composio 团队使用同一个 Kimi K3 模型,对比 Claude Code、Hermes 和 Kimi Code 等 Agent harness 的执
完整摘要
Composio 团队使用同一个 Kimi K3 模型,对比 Claude Code、Hermes 和 Kimi Code 等 Agent harness 的执行开销。结果显示,框架设计会显著改变上下文组织、工具调用和 Token 消耗,极端情况下成本相差约 30 倍。
怎么做的 / 核心机制
固定底层模型为 Kimi K3,在 Claude Code、Hermes、Kimi Code 等不同 Agent harness 中运行任务,对比上下文组织、工具调用循环和 Token 消耗。
关键结果 / 已披露进展
同一模型在不同框架中的 Token 成本最高相差约 30 倍,说明 Agent 成本很大一部分来自 harness,而不是模型单价本身。
为什么值得看
Agent 的实际成本不能只由底层模型价格解释。Harness 如何维护上下文、反馈工具结果和安排循环,可能比模型选择本身更影响延迟与费用。
局限与判断
结果依赖任务集、配置和具体实现,未必能直接外推到所有模型。更低 Token 消耗也可能牺牲任务成功率,因此必须结合成功率、延迟和质量一起看。
原始标题:Claude Code到底有多费token?对比实验来了:三大框架最多差30倍
编辑:GPT · 2026-08-02 · 质量评分 87/100
编辑:GPT · 2026-08-02 · 质量评分 87/100