GLM-5.3-Flash iguala a Jev como modelo de decisión en una sola pasada
Turning GLM-5.3-Flash into a Jev-like decision model

Un LLM estándar puede tomar decisiones tipadas en una sola pasada hacia adelante, sin fine-tuning, numerando las opciones en el prompt y leyendo las probabilidades del primer token. Con GLM-5.3-Flash en Privatemode, el método alcanza la precisión y velocidad de Jev en 28 datasets de texto, y además permite decisiones sobre imágenes. En latencia, Privatemode responde en 180 ms desde Alemania frente a los 264 ms de Jev; el costo por millón de decisiones es de 62 € frente a 16 €.
Nuestra idea central es que no es necesario que el LLM prediga todo el objeto JSON, ya que conocemos su forma de antemano. Solo nos interesa el juicio tipado del LLM para una entrada dada.