Databricks, 수백만 줄 코드베이스에서 코딩 에이전트 벤치마킹 결과 공개

Benchmarking coding agents on Databricks' multi-million line codebase

Databricks, 수백만 줄 코드베이스에서 코딩 에이전트 벤치마킹 결과 공개

Databricks가 자체 엔지니어링 워크플로우를 기반으로 구축한 내부 코딩 벤치마크 결과를 공개했습니다. 실제 PR과 테스트를 활용해 다중 언어(수백만 줄 규모) 코드베이스에서 모델과 하네스를 평가했으며, 주요 발견점은 다음과 같습니다: 최고 성능을 내는 모델은 OpenAI, Anthropic, 오픈소스가 혼재되어 있으며, GLM 5.2가 최상위 성능을 보이면서도 비용이 저렴했습니다. 또한 토큰 가격이 실제 작업 비용을 반영하지 못하고, 하네스 선택이 비용과 품질에 큰 영향을 미친다는 점을 확인했습니다. Databricks는 이 결과를 바탕으로 모델 라우팅과 효율성 개선에 나설 계획입니다.

토큰 가격은 실제 작업 비용을 제대로 반영하지 못합니다. 더 큰 모델이 토큰 효율이 훨씬 높아 전체 비용이 더 낮을 수 있습니다.

이 날의 다른 글

2026-07-09