Baue dein eigenes Entscheidungsmodell

Build your own decision model

Ein Entscheidungsmodell im System-1-Stil kann mit einem LLM nachgebildet werden, indem man die Ausgabe auf feste Optionen beschränkt. Mit Qwen/Qwen3-1.7B erreicht ein solches Modell auf CommonsenseQA eine Genauigkeit von 59,4 %, nach Finetuning 62,4 %. Die Ausgabewahrscheinlichkeiten sind jedoch oft schlecht kalibriert: Bei 98,5 % Konfidenz liegt die tatsächliche Trefferquote nur bei 70 %. Temperaturskalierung mit T=3,8 verbessert die Kalibrierung deutlich.

Wenn wir die Konfidenzwerte in Bereiche einteilen, sehen wir, dass die Konfidenz des Modells nicht mit seiner Genauigkeit übereinstimmt. Das bedeutet, dass das Modell nicht kalibriert ist.
  1. sachaa

    Das ist ein großartiger Einstieg, aber die Performance von LLM-Modellen wie Qwen ist für die lokale Ausführung nicht ideal. Ich habe Laya (reines Entscheidungsmodell) so angepasst, dass es im Browser läuft, und ich bekomme Antworten in unter 200 ms. Probier es aus: https://wexare-ai.github.io/browser-laya/

  2. sn0n

    Ich sah Jev und sagte mir, ohne es zu verstehen: „Das kann ich bauen!“ Und ich habe einen seltsamen Alex Trebek Jeopardy-Generator gebrainstormt, den ich trebek nannte, eine mit bun laufende TypeScript-App, der man eine Eingabe gibt, sie entscheidet, ob es eine Kategorie, Frage oder Antwort ist, und dann generiert, was fehlt. Ich habe ein paar Tage lang eine SQLite-vec-Datenbank mit der englischen Sprache trainiert, mit einem kleinen Qwen-Embedding-Modell, um Vec-Embeds zur DB hinzuzufügen, und dann habe ich die Embeds abgeklemmt, bevor ich anfing, meinem LLM die richtigen Spezifikationen für Jev zu füttern, und jetzt habe ich einen coolen Jeopardy-Generator, der jetzt auch als Jev-Klon-Klassifikator mit einem benutzerdefinierten v1-Endpunkt für System 0 oder was auch immer dient. Level-Verständnis hier, aber ein lustiges Experiment ^>^ und liefert nützliche Ausgaben

  3. nico

    Das ist sehr cool. Wenn du etwas Ähnliches suchst, aber leichter, das du auf der CPU laufen lassen (und trainieren) kannst, probier Jeffy aus: https://jeffyclassify.com/

    Auf GitHub: https://github.com/nicobrenner/jeffy

  4. fuddle

    Ich freue mich auf ein Buch „Baue dein eigenes Entscheidungsmodell (von Grund auf)“.

  5. ford

    Diese sind nett – und die Quelle der vielen Jev-Klone, die wir gesehen haben. Ich denke, ihre jüngste Finanzierungsrunde ist teilweise auf ihre Algorithmen/Daten zurückzuführen. Es bleibt abzuwarten, ob das ein großer genug Vorteil ist, um über 1 Milliarde Dollar wert zu sein.

Mehr von diesem Tag

2026-10-10