AI 코딩 에이전트, 실제 기업 코드베이스에서 최고 성능 38.8%에 그쳐

Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases

Specific Labs가 비공개 기업 코드베이스에서 프론티어 AI 모델을 평가하는 Real-SWE 벤치마크를 공개했다. Fable 5.1이 38.8% 해결률로 1위를 차지했지만, 10개 작업 중 6개는 해결률이 15% 미만이었다. 실패 원인은 대부분 요구사항 누락과 검증되지 않은 가정 때문이며, 10분 미만 롤아웃의 71.4%가 실패했다. 실제 기업 코드의 99%는 프론티어 모델에 공개되지 않아 분포 외 작업이다.

실제 기업의 토큰 99%는 프론티어 모델로부터 숨겨져 있다.

이 날의 다른 글

2026-09-12