Jev de TypeSafe está mal calibrado: sus probabilidades apenas superan una conjetura plana

How accurately calibrated is Jev?

Jev de TypeSafe está mal calibrado: sus probabilidades apenas superan una conjetura plana

Jev, el modelo clasificador "System One" de TypeSafe, promete distribuciones de probabilidad tipadas para decisiones. Pero al probarlo con 1,000 preguntas de física cuyas respuestas son distribuciones conocidas (Gaussian, Maxwell, Poisson, etc.), su error de variación total es de 0.518, apenas mejor que el 0.546 de repartir la probabilidad uniformemente. Jev identifica correctamente qué distribución corresponde, pero falla al generarla: produce distribuciones demasiado puntiagudas y asigna peso a colas que deberían ser casi nulas. Esto cuestiona su uso como juez automático de respuestas de LLM.

Si Jev se rindiera por completo y repartiera la probabilidad uniformemente entre todas las opciones, obtendría una TV media de 0.546. Pero Jev obtiene 0.518.
  1. clarle

    ¿Acaso preguntar a humanos no tendría este mismo tipo de problema también?

    Si le pidieras a un conjunto de humanos que generen una distribución aleatoria de caras o cruces a partir de lanzamientos de moneda, tampoco se parecería a una distribución real de lanzamientos de moneda, porque nosotros también tenemos nuestros propios sesgos. [1]

    [1] "Heads or tails?"--a reachability bias in binary choice" - https://pubmed.ncbi.nlm.nih.gov/24773285/

  2. amluto

    He estado reflexionando sobre esta situación. Creo que lo que el autor quiere de un modelo tipo Jev no es en absoluto lo que yo quiero de él.

    > Decidí comprobarlo con preguntas cuya respuesta se entiende bien. Por ejemplo:

    > Una partícula clásica de masa m está inmersa en un sistema en equilibrio termodinámico con temperatura T. ¿Cuál es su velocidad v?

    Si le doy eso a un modelo, la respuesta que quiero es: "la combinación del modelo y el estado proporcionado no tiene nada útil que añadir a tu prior".

    Si quiero conocer la distribución de Maxwell-Boltzmann, puedo buscarla, derivarla o pedirle a un LLM sofisticado que lo haga por mí (a costa de algunos tokens de razonamiento y algo de tiempo; a menos que esté usando un sistema de inferencia ultrarrápido, no obtendré esta respuesta en 50 ms). [0]

    De manera similar, si quiero saber que el 73 % de las solicitudes entrantes de soporte al cliente son spam/fraude, debería medirlo: es una propiedad de mi sistema, requiere cierta clasificación manual y una consulta a la base de datos, y será un porcentaje distinto del que vería tu sistema de soporte al cliente. Ni espero ni quiero que mi clasificador sepa esto (a menos que esté usando un clasificador convencional entrenado manualmente con mis datos, y el objetivo de Jev es precisamente evitar esto).

    Lo que quiero de un sistema como Jev es que me diga cómo cambian las probabilidades como resultado de los datos por muestra que proporciono. Lo cual, en el caso de esta pregunta sobre la distribución de Boltzmann, no es nada: no proporcioné datos y el clasificador no puede inferir nada.

    [0] Una re […]

  3. dvt

    > Así que Jev sí sabe qué distribuciones son correctas, simplemente falla al producirlas

    Afirmaciones como esta necesitan ser analizadas en profundidad. Los modelos tienen algunas capacidades emergentes[1], y creo que hay muchas pruebas que demuestran que la semántica realmente se aprende (Word2Vec), y que algunas matemáticas también podrían aprenderse (por ejemplo, la aritmética modular). Pero es difícil decir exactamente dónde hay algún mecanismo interno que genera una respuesta verdadera y dónde simplemente tenemos suerte con alguna distribución, de modo que la respuesta solo parece correcta.

    [1] https://arxiv.org/pdf/2502.00873

Más de este día

2026-10-02