Cuando los jueces LLM coinciden, ¿deberíamos creerles?

When LLM judges agree, should we believe them?

Un panel de diez jueces LLM que votan ocho a favor de "relevante" parece una evidencia sólida, pero la cuenta de votos puede exagerar la fuerza real si los jueces comparten prompt, linaje de entrenamiento o familia de modelos y repiten el mismo error. Investigadores de Amazon Science proponen modelar el panel como una red con un modelo de Ising que captura la dependencia por pares entre jueces, distinguiendo evidencia independiente de errores compartidos sin necesidad de etiquetas humanas. Su método supera al voto ponderado por precisión histórica entre un 9% y un 14% en tres tareas con paneles de diez jueces.

Si los ocho jueces que coinciden son fuentes de evidencia genuinamente distintas, la coincidencia es una señal fuerte. Pero si comparten una plantilla de prompt, un linaje de entrenamiento, una familia de modelos o un punto ciego común, puede que estén repitiendo el mismo error.

Más de este día

2026-09-14