Jeff: 0,8B-Modelle treffen Entscheidungen in 28 ms – trainiert auf einer einzigen Workstation-GPU
Jeff – Jev-compatible 0.8B decision models, trained at home, ~30 ms

Jeff sind winzige Fine-Tunes von Qwen3.5 und Gemma 4 für Zero-Shot-Klassifikation: Man beschreibt eine Situation und die Optionen in Worten, das Modell liefert in einem einzigen Forward-Pass eine kalibrierte Wahrscheinlichkeit pro Option – ohne generierten Text. Auf einer RTX PRO 6000 dauert eine Entscheidung etwa 22 ms, auf einem Apple M4 Max 28 ms. Das Training lief komplett lokal: die 0,8B-Variante in rund zwei Stunden auf einer Workstation-GPU, mit synthetischen Daten von Qwen3.8-Flash-Next. Auf Klassifikations-Benchmarks erreicht Jeff Werte wie Jev, bleibt bei Reasoning-Aufgaben aber deutlich darunter.
Ein kurzes Fine-Tuning auf eigenen Beispielen bringt deutlich mehr: Unser Voice-Navigation-Fine-Tune hob die Held-out-Genauigkeit in weniger als einer halben Stunde auf einer GPU von 31,7 % auf 95,8 %.
- adrithmetiqa
Verzeiht mein mangelndes Verständnis, aber wie lange wird es dauern, bis Jev-artige Funktionalität direkt in alle Frontier-Modelle eingebaut wird?
- AgentMasterRace
Ich habe es in meinen aktuellen Anwendungsfällen mit Jev verglichen, und es ist sehr ungenau. 70 % vs. 94 %. Für Klassifikation ist das inakzeptabel.
- trebligdivad
Welcher Anteil der kommerziellen LLM-Nutzung ist Klassifikation? Ich frage mich nur, was mit den Ausgaben für Business-KI und der Nutzung von Rechenzentren passiert, wenn die Leute merken, dass sie keine vollwertigen LLMs brauchen.
- phlipski
Für diejenigen eines bestimmten Alters – die Tatsache, dass Askjev.com noch verfügbar ist, verblüfft mich.
- imranq
Alle, die sagen, man könne Jev oder Entscheidungsmodelle durch ein LLM mit angeflanschter Schema-Ausgabe-Beschränkung ersetzen, verfehlen völlig den Punkt. Es geht um extreme Geschwindigkeit und Kosteneffizienz bei hoher Qualität, und beides bekommt man mit LLMs nicht, auch nicht mit diesen KV-Cache-Tricks.
- velominati
Typesafe hat sich ziemlich bedeckt gehalten, was die zugrunde liegende Technologie hinter Jev angeht. Angesichts der Geschwindigkeit und der Kosten ist meine Hypothese, dass es Tokens nicht so verarbeitet wie LLMs, also nicht jedes Wort durchläuft und die Verbindungen zwischen ihnen zieht. Das ist ein O(n^2)-Problem, weshalb LLMs beim Skalieren so teuer sind.
- qtalen
Großartig, ich habe gerade nach einem Entscheidungsmodell gesucht, das lokal eingesetzt werden kann, und hier bist du. Vielen Dank!
- danbrooks
Diese Art von Projekt sieht extrem nützlich aus. Es gab viel Wirbel um Jev, aber Modelle zu haben, die lokal laufen und feinabgestimmt werden können, ist extrem hilfreich.