Jeff: 0,8B-Modelle treffen Entscheidungen in 28 ms – trainiert auf einer einzigen Workstation-GPU

Jeff – Jev-compatible 0.8B decision models, trained at home, ~30 ms

Jeff: 0,8B-Modelle treffen Entscheidungen in 28 ms – trainiert auf einer einzigen Workstation-GPU

Jeff sind winzige Fine-Tunes von Qwen3.5 und Gemma 4 für Zero-Shot-Klassifikation: Man beschreibt eine Situation und die Optionen in Worten, das Modell liefert in einem einzigen Forward-Pass eine kalibrierte Wahrscheinlichkeit pro Option – ohne generierten Text. Auf einer RTX PRO 6000 dauert eine Entscheidung etwa 22 ms, auf einem Apple M4 Max 28 ms. Das Training lief komplett lokal: die 0,8B-Variante in rund zwei Stunden auf einer Workstation-GPU, mit synthetischen Daten von Qwen3.8-Flash-Next. Auf Klassifikations-Benchmarks erreicht Jeff Werte wie Jev, bleibt bei Reasoning-Aufgaben aber deutlich darunter.

Ein kurzes Fine-Tuning auf eigenen Beispielen bringt deutlich mehr: Unser Voice-Navigation-Fine-Tune hob die Held-out-Genauigkeit in weniger als einer halben Stunde auf einer GPU von 31,7 % auf 95,8 %.
  1. adrithmetiqa

    Verzeiht mein mangelndes Verständnis, aber wie lange wird es dauern, bis Jev-artige Funktionalität direkt in alle Frontier-Modelle eingebaut wird?

  2. AgentMasterRace

    Ich habe es in meinen aktuellen Anwendungsfällen mit Jev verglichen, und es ist sehr ungenau. 70 % vs. 94 %. Für Klassifikation ist das inakzeptabel.

  3. trebligdivad

    Welcher Anteil der kommerziellen LLM-Nutzung ist Klassifikation? Ich frage mich nur, was mit den Ausgaben für Business-KI und der Nutzung von Rechenzentren passiert, wenn die Leute merken, dass sie keine vollwertigen LLMs brauchen.

  4. phlipski

    Für diejenigen eines bestimmten Alters – die Tatsache, dass Askjev.com noch verfügbar ist, verblüfft mich.

  5. imranq

    Alle, die sagen, man könne Jev oder Entscheidungsmodelle durch ein LLM mit angeflanschter Schema-Ausgabe-Beschränkung ersetzen, verfehlen völlig den Punkt. Es geht um extreme Geschwindigkeit und Kosteneffizienz bei hoher Qualität, und beides bekommt man mit LLMs nicht, auch nicht mit diesen KV-Cache-Tricks.

  6. velominati

    Typesafe hat sich ziemlich bedeckt gehalten, was die zugrunde liegende Technologie hinter Jev angeht. Angesichts der Geschwindigkeit und der Kosten ist meine Hypothese, dass es Tokens nicht so verarbeitet wie LLMs, also nicht jedes Wort durchläuft und die Verbindungen zwischen ihnen zieht. Das ist ein O(n^2)-Problem, weshalb LLMs beim Skalieren so teuer sind.

  7. qtalen

    Großartig, ich habe gerade nach einem Entscheidungsmodell gesucht, das lokal eingesetzt werden kann, und hier bist du. Vielen Dank!

  8. danbrooks

    Diese Art von Projekt sieht extrem nützlich aus. Es gab viel Wirbel um Jev, aber Modelle zu haben, die lokal laufen und feinabgestimmt werden können, ist extrem hilfreich.

Mehr von diesem Tag

2026-09-28