Kimi K3 在 AA-Briefcase 中仅次于 Fable 5

Kimi K3: second only to Fable 5 on AA-Briefcase

Kimi K3 在 AA-Briefcase 中仅次于 Fable 5

Moonshot AI 最新推出的 Kimi K3 模型在 AA-Briefcase 智能体知识工作基准测试中表现亮眼,Elo 评分高达 1543,仅次于 Claude Fable 5。尽管其分析质量与 Fable 5 相当,但在演示质量上略显不足。更值得注意的是,Kimi K3 的运行成本极高,平均每个任务耗资 10.57 美元,耗时近一小时,远超 Opus 4.8 等竞品。这款拥有 2.8T 参数的模型虽然性能强劲,但高昂的 Token 消耗和推理时间使其在实际应用中面临成本挑战。

Kimi K3 在 AA-Briefcase 智能体知识工作基准测试中仅次于 Fable 5,但运行成本却高于 Opus 4.8,且每个任务平均耗时近一小时。
  1. eugene3306

    他们测试用的是哪个 harness?

    回到 2025 年,用不同的 harness 测试模型是很常见的做法。

    我记得有个 YouTube 博主,专门拿 opencode、cline、codex、claude 等各种新模型跑测试。

    为什么后来就不流行了?

    EDIT:啊,对了。关键在于 harness 本身往往会对结果(我猜是任务完成率)造成超过 10% 的影响。

  2. am17an

    现在成本很高,我预计一旦接入推理提供商,价格会降到极低。到那时它才真正配得上“思维的自行车”这个称号——Fable 当初就是承诺要做这个,可惜它太反复无常,根本做不到。

  3. felufe

    这篇帖子完全没提成本效率。他们得展示每 ELO 分数的成本,然后用逆逻辑曲线进行线性化处理。

    用这种评级方法,你会得到截然不同的结果。

    如果你需要高端推理,完全可以稍微从最高效率点往下走一点,去寻找那个最佳平衡点——那大概率是 ChatGPT 5.6 Sol。

同日更多故事

2026-07-22