Jev от TypeSafe AI: калибровка важнее точности в System One моделях
Jev and System One Models: Calibration Beats Accuracy

TypeSafe AI выпустила Jev — первую «System One» модель, которая не генерирует текст, а отвечает на типизированные вопросы за один проход, приписывая вероятность каждому ответу. Автор, имеющий опыт продакшн-классификаторов, считает, что главное здесь — не скорость, а калибровка: именно она тихо ограничивала все его модели. Он разбирает, что Jev меняет в реальном ML-стеке, и предлагает эксперимент на датасете принятия pull request'ов, чтобы проверить заявления о калибровке независимо.
Если модель говорит 0.95 на вещах, которые верны в 70% случаев, каждый установленный вами порог — ложь.