Jev es útil, pero sus probabilidades no están calibradas
Jev Can't Be Calibrated
Jev, el primer "System One Model" de TypeSafe, clasifica sin datos de entrenamiento y devuelve decisiones tipadas con probabilidades. Sin embargo, la calibración no es una propiedad del modelo sino de la distribución de tus datos: la misma probabilidad puede ser correcta para una empresa y errónea para otra. El autor recomienda tratar las salidas de Jev como scores, no como probabilidades, y recalibrarlas con unos cientos de ejemplos propios.
Mientras escribía este post encontré estos tweets, donde Jev dice que una moneda justa sale cara con probabilidad 0.92. Eso es peor que el drift explicado arriba. La probabilidad real está en el prompt, y el modelo aún así no la reporta.