Databricks' interner Benchmark: Coding-Agents im Millionen-Zeilen-Test

Benchmarking coding agents on Databricks' multi-million line codebase

Databricks' interner Benchmark: Coding-Agents im Millionen-Zeilen-Test

Databricks hat einen internen Benchmark entwickelt, um Coding-Agenten an realen Aufgaben aus ihrer eigenen Multi-Millionen-Zeilen-Codebasis zu messen. Die Ergebnisse zeigen: Die Pareto-Grenze aus Qualität und Kosten umfasst Modelle von OpenAI, Anthropic und Open Source. Open-Source-Modelle wie GLM 5.2 erreichen das höchste Leistungsniveau, während der Token-Preis ein schlechter Indikator für die tatsächlichen Kosten pro Aufgabe ist. Auch die Wahl der Harness beeinflusst Kosten und Qualität erheblich. Der Artikel beschreibt die Methodik, die Erkenntnisse und die Pläne, die Modellauswahl automatisiert zu optimieren.

Jedes Team mit einem Backlog an gemergten Pull Requests sitzt bereits auf einem Benchmark, auf dem kein Modell trainiert wurde – bewertet durch die Tests, die dein Team geschrieben hat.

Mehr von diesem Tag

2026-07-09