SWE-2 de Cognition alcanza 92.8 en Terminal-Bench 2.1

Cognition's SWE-2 achieves 92.8 on Terminal-Bench 2.1

SWE-2 de Cognition alcanza 92.8 en Terminal-Bench 2.1

Cognition post-entrenó el modelo base Kimi K3, de 2.8 billones de parámetros totales y 104 mil millones activos por token (MoE), y lo llevó al régimen de RL multi-billón por primera vez. SWE-2 logra 92.8 en Terminal-Bench 2.1, el puntaje más alto de la tabla publicada, y 50.0 en FrontierCode 1.1, a solo un punto de Claude Fable 5.1 y con un costo 64% menor. Su punto débil es Terminal-Bench 4.0, con 27.3 frente a 55.8 de Fable 5.1 y 57.9 de GPT-6 Astra. Los pesos son propietarios y no hay API por token.

El punto débil es Terminal-Bench 4.0, donde el 27.3 de SWE-2 queda muy por detrás de Fable 5.1 (55.8) y GPT-6 Astra (57.9): el trabajo agéntico de horizonte largo es donde todavía vive la brecha con la frontera.
  1. samusiam

    Lo cual es prácticamente un benchmark inútil (es decir, saturado, contaminado) a estas alturas.

  2. forgot-my-pw

    Terminal Bench 2/2.1 parece estar casi resuelto, así que probablemente no deberíamos fijarnos demasiado en eso, ¿no? Su puntuación en Terminal Bench 4 es más bien regular.

    Aun así, bastante impresionante.

  3. captainregex

    mi experiencia personal con swe ha sido... subóptima. No estoy seguro de cuánto me creo estos benchmarks y tiene un estilo muy de "soltarlo sin más aunque probablemente no sea correcto", pero bueno, es gratis.

Más de este día

2026-09-10