Jevの確率分布は驚くほど不正確だ
How accurately calibrated is Jev?

TypeSafeのSystem OneモデルJevは、選択肢に対する確率分布を返す。著者は物理法則が既知の10種類の分布(Gaussian、Maxwell、Poissonなど)で1,000通りのテストを行い、Total Variationでキャリブレーションを評価。Jevの平均TVは0.518で、一様に確率をばら撒く場合の0.546とほぼ変わらない。特にUniform分布ではTVが0.77に達し、Poissonでは0.65と、一様推測の0.64と同程度だった。Jevは分布の種類を正しく特定できるが、確率質量を1つのビンに集中させる過信傾向がある。
Jevに完全に諦めて全ての選択肢に確率を均等に配分させると、平均TVは0.546になる。しかしJevのスコアは0.518だ。
HNでの議論
13- clarle
人間に尋ねた場合も、同じような問題が起きるのではないだろうか?
コイントスの表か裏かのランダムな分布を生成するように、ある一群の人間に頼んだとしても、それは現実世界のコイントスの分布とは似たものにはならないだろう。なぜなら、私たちにもまた自分自身のバイアスがあるからだ。 [1]
[1] "Heads or tails?"--a reachability bias in binary choice" - https://pubmed.ncbi.nlm.nih.gov/24773285/
- amluto
この状況についてずっと考えている。著者がJevのようなモデルに求めているものは、私が求めているものとは全く違うと思う。
> 答えがよく理解されている問題でこれを確認することにした。例えば:
> 質量mの古典粒子が、温度Tの熱力学的平衡状態にある系に埋め込まれている。その速度vは?
もしこれをモデルに入力したら、私が欲しい答えは「モデルと与えられた状態の組み合わせは、あなたの事前分布に有用なものを何も付け加えない」だ。
マクスウェル=ボルツマン分布を知りたいなら、調べるか、自分で導出するか、あるいは高性能なLLMにやらせる(推論トークンと時間のコストがかかる——超高速推論システムを使っていない限り、50msでこの答えは得られない)。 [0]
同様に、入ってくるカスタマーサポートリクエストの73%がスパム/詐欺だと知りたいなら、それを測定すべきだ——それは自分のシステムの特性であり、手動での分類とデータベースクエリが必要で、あなたのカスタマーサポートシステムが見る割合とは異なるだろう。私は自分の分類器がこれを知っていることを期待もしていないし、望みもしない(自分のデータで手動トレーニングした従来の分類器を使っている場合を除いて。そしてJevの要点はまさにこれを避けることだ)。
Jevのようなシステムに私が求めているのは、私が提供するサンプルごとのデータの結果として確率がどう変化するかを教えてくれることだ。このボルツマン分布の質問の場合、それは何もない:私はデータを提供しておらず、分類器は何も推論できない。
[0] A re […]
- dvt
> つまり、Jevはどの分布が正しいかを実際に知っているが、それを生成することに失敗するだけだ
このような主張は深く分析する必要がある。モデルにはいくつかの創発的能力があり[1]、意味論が実際に学習されていることを示す証拠はたくさんあると思う(Word2Vec)。また、いくつかの数学も学習されている可能性がある(例えばモジュラー算術)。しかし、真の答えを生成する内部メカニズムがどこにあり、単に何らかの分布で運が良かったために答えが正しいように見えるだけなのかを正確に言うのは難しい。