Jevの「較正済み確率」はあなたのデータでは通用しない

Jev Can't Be Calibrated

TypeSafeのSystem One Model「Jev」は、学習データなしで使える万能分類器として便利だが、その確率が較正されているという主張は一般には成り立たない。較正はモデルだけでなくデータ分布にも依存するため、同じ入力でも企業ごとに異なる分布では確率がずれる。さらに、コイン投げの確率を0.92と答える例や、プリミティブによって較正の意味が変わる実験結果もあり、出力は確率ではなくスコアとして扱うべきだと著者は論じる。

私の結論は、Jevの出力は優れた確率ではなく、優れたスコア(事例をうまく順位付けする)として扱うべきだということだ。
  1. kantahayashi

    公正なサイコロを使ってJevを400回テストしましたが、サイコロの結果は教えませんでした。面1の真の確率は1/6ですが、Jevは常に面1を選び、返された確率は約83%でした。また、公正なコインで200回テストしたところ、0.92の確率が得られました。

    いくつかのテストを行い、Jevは正解がある問題は得意だが、実際の確率のように答えが全く分からない問題は苦手だと思います。

    記事: 「Jev Does Not Play Dice」

    https://kantahayashiai.github.io/posts/jev-does-not-play-dic...

  2. jackb4040

    だからみんながなぜ大騒ぎしているのか理解できない。LLM分類器の最大の問題は、個々のビジネスをトレーニングデータ内のすべてのビジネスのぼやけた平均として扱うことだ。他のすべてを制御すれば軽い方がいいのは当然だが、少なくとも私の会社では、指示に従うのが明らかに優れているなら、かなり高価で遅い分類器を使う余地がある。

  3. abhgh

    この投稿は好きだ。Jevを詳しく調べる時間はなかったが(新規登録を受け付けていない)、較正済み確率は彼らの売り文句の一つで目を引いた。そして、ユーザーデータでどうやってそれを提供するのか疑問に思っていた。標準的な較正は、本質的に、スコア0.8が肯定的な予測を伴う場合(二値分類の単純なケースを仮定)、スコア0.8のすべての予測を集めると約80%が正しいことを保証する。

    モデルに送る例が一つだけの場合、どうやってあなたのデータで80%を保証するのか?

    参考までに、概要としてはscikitの較正に関するページが素晴らしい[1]、ずっと前に書いたQuoraの回答が特定のタイプをカバーしている[2]。

    [1] https://scikit-learn.org/stable/modules/calibration.html

    [2] https://www.quora.com/How-is-isotonic-regression-used-in-pra...

  4. bnbn88

    この誇大宣伝は価格と速度が原因だ。ほとんどの人は小さくて速いモデルを知らず、何にでも大きなモデルを使っているからだ。

  5. time0ut

    リリース以来、Jevを理解し、自分の実際のユースケースでどう機能するかを見て、中身が何なのかを突き止めるために一連の実験を行ってきた。

    私のテストのいくつかはこの投稿が言っていることを裏付けている。既存のルーブリックとスコアを一致させることはできなかった。それは「機能した」が、ずれており、望むところから圧縮されていた。悪くない出発点だが、ルーブリックを意図したところまで動かすことはできなかった。最も堅牢なテストではなく、多くの時間を費やしたわけでもないが、瞬時に魔法のように機能するわけではなかった。

    しかし、速くて安くて十分に良いというだけで本当に役立つように思えるので、まだ少し期待している。

この日のほかの記事

2026-09-23