Real-SWE: Kein KI-Modell löst alle Aufgaben in echten Enterprise-Codebasen
Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases
Specific Labs veröffentlicht Real-SWE, einen Benchmark, der Frontier-KI-Modelle auf privaten, realen Enterprise-Codebasen testet. Die Aufgaben stammen aus lizenzierten Produktionssystemen und umfassen komplexe Szenarien wie Abrechnung, Steuern und Kundenmigration. Spitzenreiter Fable 5.1 erreicht nur 38,8 % Lösungsrate, und 71,4 % der kurzen Rollouts scheitern. Häufigste Fehlerquelle: übersehene Anforderungen.
99% der Tokens in realen Unternehmen sind vor den Frontier-Modellen verborgen.