Databricks prueba agentes de código en su base de código de millones de líneas
Benchmarking coding agents on Databricks' multi-million line codebase

Databricks construyó un benchmark interno para evaluar agentes de codificación en tareas reales de su base de código de millones de líneas. Los resultados muestran que la frontera de Pareto incluye modelos de OpenAI, Anthropic y de código abierto, con GLM 5.2 destacando por su calidad y bajo costo. El precio por token es un mal indicador del costo real por tarea, y el harness utilizado puede duplicar el costo sin cambiar la calidad. Databricks ahora usa esta información para enrutar tareas a modelos más eficientes.
La lección aquí no es que un harness sea siempre más barato o que los harness nativos sean peores; la elección del modelo es solo una pieza del rompecabezas.