Ningún modelo de IA supera el 39% en tareas reales de código empresarial privado

Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases

El benchmark Real-SWE evalúa modelos frontera en tareas extraídas de bases de código privadas de empresas reales, con consecuencias de negocio y complejidad específica. Fable 5.1 lidera con 38.8% de resolución, seguido de GPT-6 Astra (33.8%) y Gemini 3.8 Flash (31.2%). El 71.4% de los intentos cortos fracasan, y el fallo más común es omitir requisitos. Cada tarea se ejecuta ocho veces por modelo, con costes estimados de $2.50 a $6.96 por rollout.

El 99% de los tokens en las empresas del mundo real están ocultos para los modelos frontera.

Más de este día

2026-09-12