Databricksのベンチマークが示す:コーディングエージェントの最適解は単一モデルではない

Benchmarking coding agents on Databricks' multi-million line codebase

Databricksのベンチマークが示す:コーディングエージェントの最適解は単一モデルではない

Databricksは、自社の数百万行規模のコードベースに対する実際のエンジニアのタスクを用いて、主要なコーディングエージェントとモデルを評価する内部ベンチマークを構築しました。その結果、最適な性能とコストのバランスを実現するには、OpenAI、Anthropic、オープンソースモデルを組み合わせる必要があることが判明。特にGLM 5.2は最高性能層に食い込み、Opus 4.8と品質で互角ながらコストは約3分の2でした。また、トークン単価は実際のタスクコストと相関せず、ハーネスの選択がコストと品質に大きな影響を与えることも明らかになりました。このベンチマークは、自社のPRから構築され、テストによる自動評価で正確性を担保しています。

モデルのトークン価格は、エンドツーエンドのタスクで実際にかかるコストの指標としては不十分です。

この日のほかの記事

2026-07-09