Jev ist schlecht kalibriert
How accurately calibrated is Jev?

TypeSafe hat mit Jev ein neues „System One“-Entscheidungsmodell vorgestellt, das auf einem Transformer basiert und multiple-choice-Antworten mit Wahrscheinlichkeiten liefert. Der Autor testet die Kalibrierung anhand physikalischer Verteilungen und findet: Jev schneidet kaum besser ab als eine gleichmäßige Zufallsverteilung. Besonders problematisch: Bei uniformen Verteilungen erzeugt es nahezu Delta-Funktionen, und es neigt generell zu übermäßig spitzen Verteilungen mit falschen Tail-Gewichten. Die Experimente kosten weniger als 4 US-Dollar.
Wenn Jev die Antwort völlig verwerfen und die Wahrscheinlichkeit gleichmäßig über alle möglichen Optionen verteilen würde, käme es auf einen mittleren TV von 0,546. Jev erreicht jedoch 0,518.
- clarle
Hätte das Fragen von Menschen nicht genau dasselbe Problem?
Wenn man eine Gruppe von Menschen bitten würde, eine zufällige Verteilung von Kopf oder Zahl bei Münzwürfen zu erzeugen, wäre diese auch nicht mit einer realen Verteilung von Münzwürfen vergleichbar, weil wir ebenfalls unsere eigenen Verzerrungen haben. [1]
[1] "Heads or tails?"--a reachability bias in binary choice" - https://pubmed.ncbi.nlm.nih.gov/24773285/
- amluto
Ich habe über diese Situation nachgedacht. Ich denke, dass das, was der Autor von einem Jev-ähnlichen Modell will, überhaupt nicht das ist, was ich davon will.
> Ich beschloss, dies an Fragen zu überprüfen, bei denen die Antwort gut verstanden ist. Zum Beispiel:
> Ein klassisches Teilchen der Masse m ist in ein System im thermodynamischen Gleichgewicht mit der Temperatur T eingebettet. Was ist seine Geschwindigkeit v?
Wenn ich das in ein Modell eingebe, ist die Antwort, die ich will: „Die Kombination aus Modell und dem bereitgestellten Zustand hat deinem Prior nichts Nützliches hinzuzufügen.“
Wenn ich die Maxwell-Boltzmann-Verteilung wissen will, kann ich sie nachschlagen oder herleiten oder ein schickes LLM bitten, das für mich zu tun (auf Kosten einiger Reasoning-Tokens und etwas Zeit – es sei denn, ich verwende ein ultraschnelles Inferenzsystem, bekomme ich diese Antwort nicht in 50 ms). [0]
Ähnlich verhält es sich, wenn ich wissen will, dass 73 % der eingehenden Kundensupport-Anfragen Spam/Betrug sind – das sollte ich messen; es ist eine Eigenschaft meines Systems, erfordert manuelle Klassifizierung und eine Datenbankabfrage, und es wird ein anderer Prozentsatz sein als der, den dein Kundensupport-System sehen würde. Ich erwarte weder noch will ich, dass mein Klassifikator das weiß (es sei denn, ich verwende einen herkömmlichen Klassifikator, der manuell auf meine Daten trainiert wurde, und genau das soll Jev ja vermeiden).
Was ich von einem System wie Jev will, ist, mir zu sagen, wie sich die Wahrscheinlichkeiten aufgrund der pro Sample bereitgestellten Daten ändern. Was im Fall dieser Boltzmann-Verteilungsfrage nichts ist: Ich habe keine Daten bereitgestellt und der Klassifikator kann nichts ableiten.
[0] A re […]
- dvt
> Jev weiß also tatsächlich, welche Verteilungen korrekt sind, es schafft es nur nicht, sie zu erzeugen
Aussagen wie diese müssen gründlich analysiert werden. Modelle haben einige emergente Fähigkeiten[1], und ich denke, es gibt viele Belege dafür, dass Semantik tatsächlich gelernt wird (Word2Vec), und manches in der Mathematik scheint ebenfalls gelernt werden zu können (z. B. modulare Arithmetik). Aber es ist schwer, genau zu sagen, wo ein interner Mechanismus eine wahre Antwort erzeugt und wo wir einfach Glück mit einer Verteilung haben, sodass die Antwort nur richtig erscheint.