Ningún modelo de IA supera el 39% en tareas reales de código empresarial privado
Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases
El benchmark Real-SWE evalúa modelos frontera en tareas extraídas de bases de código privadas de empresas reales, con consecuencias de negocio y complejidad específica. Fable 5.1 lidera con 38.8% de resolución, seguido de GPT-6 Astra (33.8%) y Gemini 3.8 Flash (31.2%). El 71.4% de los intentos cortos fracasan, y el fallo más común es omitir requisitos. Cada tarea se ejecuta ocho veces por modelo, con costes estimados de $2.50 a $6.96 por rollout.
El 99% de los tokens en las empresas del mundo real están ocultos para los modelos frontera.