GLM-5.3, el modelo open-weight que supera a Anthropic y OpenAI por una quinta parte del costo
GLM-5.3 (open-weight) beat Anthropic/OpenAI models – for 1/5 the cost

El nuevo líder del Ed-o-meter, un ranking de 17 modelos evaluados en 28 tareas reales, es GLM-5.3, que logra un 100% de aprobación y una puntuación de 9.3, superando a modelos de Anthropic y OpenAI a un costo de solo $0.28 por vuelta, aproximadamente una quinta parte del costo de GPT-5.5. El análisis también revela que Fable-5 y Opus-5 se negaron a completar varias tareas, y que la línea GPT-5.6 tiene problemas de seguridad. El ranking destaca alternativas económicas como GPT-5.6-Luna y Haiku-4-5, y modelos rápidos como Gemini-3.6-Flash.
Si solo ejecutas un modelo, ejecuta GLM-5.3: 100% de aprobación, una puntuación de 9.3, $0.28 por vuelta, aproximadamente una quinta parte del costo de GPT-5.5 (pero verifica primero el cumplimiento).
- hellohello2
Todo esto me suena inmediatamente a texto generado por Claude, lo que hace difícil tomarlo en serio.
¿Por qué estos resultados contradicen los intentos serios existentes de evaluar LLMs? En concreto:
- jchw
Casi 10 modelos superan el benchmark con >95% - ¿no está eso... bastante sobresaturado?
También soy muy escéptico con los benchmarks que colocan a cualquier modelo Haiku muy arriba. Haiku nunca me ha impresionado y mi opinión es que básicamente no deberías usarlo. Y sin embargo, aquí empata con Kimi K3. HMMMM.
"Rubric Quality" parece un poco más realista que "Pass Rate", pero aparentemente lo juzga Fable 5...
Además, todo este escrito está claramente muy asistido por IA, lo que no ayuda en nada.
- gertlabs
Un problema es que $30 por ejecución es muy ruidoso para muchas tareas verificables. Las nuestras suelen necesitar al menos un orden de magnitud más para un modelo en la clase de precio de GLM 5.3.
Acabamos de publicar los resultados de GLM 5.3 en nuestras evaluaciones de codificación multiagente y es definitivamente un modelo impresionante, quedando alrededor del #6. Por el precio, en realidad no es Pareto óptimo, quedando ligeramente por detrás de Grok 4.6 (que es más rápido y al mismo precio) y Sol 5.6 (que usa muchos menos tokens de razonamiento para resultados comparables). Como con la mayoría de los modelos chinos, sobresale iterando en un entorno controlado mientras que su primera respuesta/inteligencia fluida base está por debajo de la frontera americana.
Datos en https://gertlabs.com/rankings
- iamcoder18
No hay manera de que GPT 5.5 sea mejor que GPT 5.6 Sol, y gemini-3.6-flash sea mejor que ambos. No me fiaría de este benchmark en absoluto.
- solenoid0937
No sé, yo uso modelos abiertos todos los días para proyectos personales, y modelos cerrados para el trabajo.
Los modelos abiertos están decididamente muy por detrás de Fable y un buen trecho por detrás de Opus también. Todas estas publicaciones me parecen pensamiento ilusorio o interesado.
Entiendo que la gente quiera desesperadamente que la frontera abierta esté donde está la cerrada, pero es tan obvio que no es el caso si realmente usas los modelos en un proyecto real.
- ac29
No me fío de un benchmark donde Haiku obtiene una puntuación casi perfecta y Fable queda empatado en el último lugar
- Klaster_1
Durante la última semana, he estado profundamente inmerso en ingeniería inversa de un dispositivo con la ayuda de GLM-5.3 y superó todas mis expectativas - de hecho logré mucho más de lo que pensé que lograría. Nunca había trabajado en algo tan de bajo nivel, me habría llevado meses aprender ensamblador ARM y cómo encontrar y escribir exploits. Inicialmente, intenté esto con Claude, pero me bloqueó en el primer mensaje, así que me reembolsaron y decidí probar z.ai. Los únicos inconvenientes son que quizás es un poco más lento que mi Opus del trabajo y tuve que pagar ~200 EUR por un plan mensual para no chocar con los límites semanales en un par de días. Si este nivel de capacidad costara quizás 50 EUR, consideraría seriamente suscribirme a largo plazo.
- CMay
> si ejecutas un modelo, ejecuta glm-5.3
Esa es una conclusión horrible de esto, con solo 28 tareas y una alta tasa de aprobación para la mayoría de los modelos, no dice casi nada.
Prueba un modelo para tu caso de uso y usa el modelo más rápido, pequeño y barato que satisfaga al 100% tu caso de uso.
O, si realmente necesitas un modelo con un rendimiento general fuerte, definitivamente no te tomes en serio un benchmark como este con un conjunto de tareas tan limitado.