Databricks实测:AI编码代理的真实成本

Benchmarking coding agents on Databricks' multi-million line codebase

Databricks实测:AI编码代理的真实成本

在Databricks,我们不再盲目追求最贵的模型。通过在数百万行代码库上进行的内部基准测试,我们发现OpenAI、Anthropic以及开源模型GLM 5.2各有千秋。有趣的是,模型每Token的价格往往无法反映真实任务成本,大模型反而可能更省钱。此外,工具框架(Harness)的选择对效率和成本影响巨大,简单的Pi框架在特定场景下表现优异。我们建议根据任务难度灵活切换模型,而非默认使用顶级模型,从而在保持高质量的同时显著降低开发成本。

模型的每Token价格往往是衡量端到端任务实际成本的糟糕指标。
  • Pi 框架在真实场景下表现优于厂商原生 harness,能以更少的上下文消耗和更低的单任务成本实现同等甚至更高的通过率。
  • GLM 5.2 搭配 Pi 的性价比极高,其任务成本显著低于 Opus 4.8,且通过率几乎持平,仅在 Opus 开启 x-high 模式时才能以双倍成本换取微弱优势。
  • 模型厂商存在推高 Token 消耗的商业动机,例如 Anthropic 近期调整 tokenizer 导致相同代码输入产生 30% 更多 Token,而 Pi 的上下文管理效率是 Claude Code 的 2.2 倍。
  • 企业用户采用 AI 编码代理面临激励错位:清理遗留代码难以量化为直接收入,导致在大型公司中难以获得优先级,而构建新功能更容易获得晋升和预算。
  • 针对复杂任务,单纯依赖模型重试成本过高,业界最佳实践是引入后处理脚本进行 lint 检查、标记已知错误并修复常见格式问题,而非盲目增加 Token 预算。

同日更多故事

2026-07-09