精度よりキャリブレーションが勝つ:JevとSystem Oneモデル
Jev and System One Models: Calibration Beats Accuracy

TypeSafe AIが発表したJevは、チャットも生成もしない「System Oneモデル」だ。構造化された質問に単一のフォワードパスで答え、各回答に確率を付ける。著者は、本番環境の分類器を悩ませてきたキャリブレーションの問題に焦点を当て、Jevの主張を検証する実験を提案する。PR受け入れ予測パイプラインを使い、AUC、Brierスコア、ECEで評価する。
「較正が本当のボトルネックであり、精度ではない」
HNでの議論
11- rahimnathwani
彼が「このカスタマーサポートメッセージはどれくらい緊急か?」に対処するために提案した方法は「順序付きレベルに対するスコア」だ。
このユースケースでJevを使う良い方法だとは思えない。もし私がこの問題を抱えていたら、Jevに各メッセージについて複数の異なるはい/いいえの質問に答えさせ、その確率をロジスティック回帰モデルの入力として使って緊急度を予測するだろう。
入力から合理的に客観的に答えられる具体的なはい/いいえの質問をモデルにすれば、その答えはモデルの世代を重ねてもより安定すると思う。
例えば「顧客は怒っているか?」と尋ねれば、その答えはモデル間で、またモデルと人間の間で高い一致が見られるはずだ。しかし「緊急か?」という質問に直接答えるのはずっと難しい。(まあ、プロンプトにルールを書くこともできるだろうが。)
- amluto
私には、Jevはかなり厳密な意味で、そのままでは有用にキャリブレーションできないように思える。プルリクエストがあって、状態がタイトルや説明などだとしよう。問題は「これはマージされるか?」だ(選択肢か「noul」[0]かは実際には関係ない)。
ここで、2つの異なるプロジェクトがPRを受け入れる基準を根本的に異にしている可能性を考えてみよう。そして、2つのプロジェクトは、受け取るPRの分布からランダムなPRを受け入れる確率(つまり受け入れられるPRの全体的な割合)が異なるかもしれない。では、Jevは両方に対して「キャリブレーションされた」ものを一体何を返せるだろうか?そもそも「私にはわからない」という選択肢すら持っていない。なぜなら出力スキーマは、「答えがまだ状態に条件付けられているとして、確率が50%であると確信している」と、「状態から抽出できる有用な情報が何もないので、事後分布は事前分布と同じと仮定すべきだ」を区別できないからだ。
面白半分で、Jevに無関係な状態を与え、その状態が役に立たない様々な質問(スポーツの結果を選んだ)をしたところ、明らかに正しい無情報の答えに特に近い、あるいは事前分布が0.5から遠い場合に0.5に近い、はい/いいえの確率を与えることにかけては0勝3敗だった。
これは馬鹿げたテストだが、私は個人的に、利用可能な最良の分類器(あるいは少なくとも、私が払える範囲に近いコストで利用可能な最良のもの)が […]
- svg7
キャリブレーションはあなたのデータセットで測定されなければならない。確率の合計が1になるからといって、JevやJevのようなモデルがキャリブレーションされているわけではない。キャリブレーションをさらに深く掘り下げたい人にとっては、キャリブレーションが非常に重要な広告クリック予測モデルを研究するのが良い出発点だ。