Cognition lanza SWE-2, un modelo de codificación que iguala a Fable 5.1 por un 64% menos de costo
Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra

Cognition presenta SWE-2, su modelo de codificación más avanzado, que alcanza un 50.0% en FrontierCode 1.1 Main, a solo un punto de Fable 5.1 pero con un 64% menos de costo. Entrenado con RL a escala de billones de parámetros, SWE-2 optimiza toda la frontera de Pareto mediante penalizaciones de costo ajustadas a la pendiente local. Ya está disponible en Devin Desktop y CLI, y destaca por su exploración enfocada y disciplina de verificación.
Con SWE-2, escalamos RL al régimen de múltiples billones de parámetros por primera vez, construyendo sobre la infraestructura y receta de entrenamiento de SWE-1.7.
- postalcoder
Si buscas razones para ser escéptico, no busques más que el enorme delta entre la puntuación de Terminal Bench 2.1 (92.8%) y la de Terminal Bench 4 (27.3%).
Terminal Bench 4 se lanzó hace un par de semanas, así que la diferencia que ves entre las dos puntuaciones se puede interpretar como "¿qué tan bien generaliza este modelo a problemas nuevos?" Más crudamente: "¿qué tan benchmaxxeado está este modelo?"
- gruez
Cognition, ¿la misma empresa que hace unos años demostró un bot de codificación que supuestamente podía completar tareas de Upwork de forma autónoma, pero que tras un examen más detallado se descubrió que se salía de control y ni siquiera completaba lo que se le pedía?
https://www.youtube.com/watch?v=tNmgmwEtoWE
Como han mencionado otros, esto está post-entrenado a partir de Kimi k3, que ya es bastante capaz, así que no puede ser tan malo, pero cualquier mejora de rendimiento que se afirme debería tomarse con pinzas.
- nullbio
¿Dónde están las estadísticas del modelo? ¿Es de pesos abiertos? Si no, ¿por qué iba a usar esto en lugar de DeepSeek Flash 4.1?
Creo que estos laboratorios competidores necesitan darse cuenta de que nadie quiere otro proveedor de modelos de pesos cerrados... Ni siquiera estamos contentos con los dos que tenemos ahora, y sus días están completamente contados. Si DeepSeek 4.1 flash es realmente tan bueno como indica su benchmark, probablemente estemos a un mes de que un tercio de los usuarios dejen los modelos de pesos cerrados en favor de algo sobre lo que tengan más control (o que sea más barato).
A los grandes laboratorios les encanta lanzar su nuevo modelo y cuantizarlo después de la primera semana. No tienes ese problema usando tarifas de API tiradas de precio en OpenRouter. DS 4.1 flash también es más rápido que el modo rápido de Astra. Las tarifas de suscripción de OAI son buena relación calidad-precio, pero ahora estos nuevos modelos de pesos abiertos son casi igual de baratos en tarifas de uso de API. Sinceramente, no puedo esperar al día en que ya no estemos sujetos a los dos grandes laboratorios. No me extraña que haya tanto bombo de miedo por parte de Anthropic y sus ONGs financiadas.
- captainregex
Soy escéptico. La experiencia vivida es lo que importa y no tengo a nadie en mi vida (tienda Devin) que hable bien de SWE aparte de que es gratis. Espero equivocarme y que no sea tan malo esta vez.
- TheJCDenton
> SWE-2 está post-entrenado a partir de Kimi K3
Por un lado, habría esperado un modelo completamente nuevo; por otro, es un K3 entrenado con RL que alcanza las capacidades de Fable 5, lo que demuestra que probablemente esto sea posible, lo cual es agradable.
- pkilgore
No estoy seguro de que importe cuando Devin es el producto más consistentemente mierdero que he usado. Y sí, lo intenté de nuevo, desperdiciaron el dinero en las vallas publicitarias.
- bobtheborg
SWE 1.6 era genial para tareas pequeñas. Muy rápido y suficientemente bueno. 1.7 fue inutilizable para mí. Tardaba más tiempo pensando que GLM 5.2 y parecía andar en círculos en general. Lo probé pero lo abandoné.
Espero con ganas el 2 -- quizá sea usable.
- mydreamof
¿Parece benchmaxing? Por ejemplo, para Terminal-Bench 4 no tiene grandes resultados. ¿Y por qué no mostrar otros benchmarks?