FrontierHarness Eval: 统一模型下九大框架性能成本实测
Show HN: FrontierHarness Eval – 9 harness, same model, cost per pass varies 17x
FrontierHarness Eval 在完全一致的软件工程和终端任务环境下,对 9 款主流 AI 编码框架进行了深度横评。所有测试均基于相同的模型与运行时,通过冷启动机制彻底消除了缓存偏见,确保评估的绝对中立。数据揭示了惊人的差异:在相同模型下,单次任务成本最高相差 17 倍。无论是追求极致质量的 Codex,还是主打性价比的 Exo Harness,开发者都能在此找到最适合自身需求的工具。
在完全相同的模型与运行环境下,不同框架的单次任务成本竟相差 17 倍,这彻底打破了我们对 AI 编码效率的固有认知。
HN 评论区
48- vidarh
拿 Kimi 做测试可能会让数据产生巨大偏差。Kimi 有不少 quirks(怪癖),需要像 Claude 或 GPT 那样的行为模式来应对。
围绕需要适配“怪异”模型而构建的 Harness,必须处理这些问题,比如 Kimi 容易陷入工具调用死循环。
而主要为了适配 Anthropic 模型构建的 Harness,则不需要处理这类问题。
在博客里声称这让 Kimi Code 没有主场优势,似乎是个很冒险的假设。我还没深入研究最新的 Kimi Code,但旧版 Kimi CLI 里包含了好几个明显是为了绕过这种行为而设计的工具——当我把他们的 checkpoints 和“dmail”机制复制到我自己的 harness 中时,Kimi 的性能大幅提升,但对 Anthropic 模型却毫无影响。
这并不意味着数据毫无价值——很明显你不该用 Clade Code 去跑 Kimi。但这确实大大限制了它的实用性。
- nsingh2
我觉得把 Pi 这种工具包含进来有个问题,因为它就是故意做得极简的。我不认为有人会在没有任何基本自定义扩展(比如 subagents、check lists 等)的情况下使用 Pi,所以这个基准测试可能无法代表真实的部署环境。
如果能看到一些消融测试(ablation test)也会很有趣。比如,Codex 的哪些部分对性能贡献最大,以及能否在像 Pi 这样的工具里以更精简的方式复现出来。
- markbao
这太棒了。人们总说 harness 有多重要,可我们却很少见到 harness 的基准测试。同意楼上那位评论者的观点,确实需要‘harness x model’这样的组合测试。
人们总说 Cursor 的 harness 有什么秘密配方,很想看看它到底表现如何。
感谢你们填补了这个真正的空白!
- kaishin
只在 repo 里放任务和结果是个糟糕的决定。如果任何人都能重新运行这个基准测试,这些结论会可信得多。
- joshheitzman
我本来很兴奋,直到发现成本只提供了中位数。你的服务商是按所有任务向你收费的,你可以通过将平均值乘以任务数量来反推总成本。但用中位数做不到这一点,而且我怀疑中位数很可能低于平均值,所以这实际上低估了真实成本。