Jev от TypeSafe не умеет калибровать вероятности: на равномерном распределении TV достигает 0,8
How accurately calibrated is Jev?

Автор проверил калибровку Jev — нового классификатора от TypeSafe — на 1000 задач по физике, где правильные ответы описываются известными распределениями (Максвелла, Гаусса, Пуассона и др.). Jev возвращает вероятности по бинам, но его распределения оказываются слишком островершинными: средний TV 0,518 против 0,546 у случайного угадывания, а для равномерного распределения — 0,77 против 0,39. При этом Jev отлично определяет тип распределения, но не может его воспроизвести. Автор также замечает, что посттренировка ломает калибровку LLM.
Я попросил Jev, новую решающую модель от TypeSafe AI, назвать результат броска честной игральной кости, который он не мог видеть. За 400 испытаний он каждый раз выбирал «1» и давал этому выбору среднюю вероятность 83%. Он оказался прав в 19% случаев, что соответствует случайности.
- clarle
Разве у людей не возникнет та же самая проблема?
Если попросить группу людей сгенерировать случайное распределение орлов и решек при подбрасывании монеты, оно тоже не будет похоже на реальное распределение исходов бросков монеты, потому что у нас тоже есть свои собственные предубеждения. [1]
[1] "Heads or tails?"--a reachability bias in binary choice" - https://pubmed.ncbi.nlm.nih.gov/24773285/
- amluto
Я обдумываю эту ситуацию. Думаю, что автор хочет от модели вроде Jev совсем не того, чего хочу от неё я.
> Я решил проверить это на вопросах, где ответ хорошо понятен. Например:
> Классическая частица массы m находится в системе в термодинамическом равновесии с температурой T. Какова её скорость v?
Если я скормлю это модели, ответ, который я хочу получить: «комбинация модели и предоставленного состояния не может ничего полезного добавить к вашему априорному распределению».
Если я хочу узнать распределение Максвелла — Больцмана, я могу посмотреть его, вывести сам или попросить навороченную LLM сделать это за меня (ценой некоторого количества токенов рассуждения и времени — если только я не использую сверхбыструю систему инференса, я не получу этот ответ за 50 мс). [0]
Аналогично, если я хочу знать, что 73% входящих запросов в службу поддержки — это спам/мошенничество, я должен это измерить — это свойство моей системы, для этого нужна ручная классификация и запрос к базе данных, и это будет другой процент, чем увидела бы ваша система поддержки. Я не ожидаю и не хочу, чтобы мой классификатор это знал (если только я не использую обычный классификатор, вручную обученный на моих данных, а весь смысл Jev в том, чтобы этого избежать).
Чего я хочу от системы вроде Jev — чтобы она сказала мне, как вероятности меняются в результате данных, которые я предоставляю для каждого образца. Что в случае этого вопроса о распределении Больцмана — ничего: я не предоставил никаких данных, и классификатор ничего не может вывести.
[0] A re […]
- dvt
> Так что Jev на самом деле знает, какие распределения правильные, просто не может их воспроизвести
Такие утверждения нужно глубоко анализировать. У моделей действительно есть некоторые эмерджентные способности[1], и, думаю, есть много свидетельств того, что семантика действительно выучивается (Word2Vec), и кое-что из математики, похоже, тоже может выучиваться (например, модульная арифметика). Но трудно точно сказать, где есть какой-то внутренний механизм, порождающий истинный ответ, а где нам просто повезло с некоторым распределением, так что ответ лишь кажется правильным.