PostHog Jeeves: Reasoning verbessert Jev-ähnliche Entscheidungsmodelle

Jeeves. Reasoning improves Jev-like decision models

PostHog Jeeves: Reasoning verbessert Jev-ähnliche Entscheidungsmodelle

PostHog hat Jeeves veröffentlicht, ein 9B-Modell (Qwen3.5-9B, LoRA, Pointer-Head), das vor jeder Entscheidung nachdenkt und mit SFT und CISPO trainiert wurde. Es übertrifft Kev-9B und Jev auf ungesehenen Testdaten (0,889 vs. 0,822 und 0,857) sowie auf JevBench (0,935 vs. 0,866). Ein Block-4-Diffusion-Drafter beschleunigt die Inferenz um das 1,6-Fache. Der Code, die Gewichte und die Daten sind unter MIT-Lizenz verfügbar.

Jev-ähnliche Modelle liefern kalibrierte Entscheidungswahrscheinlichkeiten, aber mit geringer Genauigkeit. Viele Pipelines greifen deshalb auf ein Reasoning-Modell als Fallback zurück.
  1. HarHarVeryFunny

    Die Anzahl der Leute, die das Bedürfnis verspüren, zu versuchen zu argumentieren, dass man Jev nicht braucht, kann nur Astroturfing von denen sein, die etwas zu verlieren haben - Anthropic- und OpenAI-Mitarbeiter.

    Ob es einem gefällt oder nicht, Unternehmen werden Jev nutzen, es sei denn, man kann etwas ebenso Günstiges und Schnelles anbieten.

    Ich frage mich, wie viel vom Markt für Geschäftsautomatisierung, der zuvor von LLMs gehalten wurde, hier auf dem Spiel steht?

  2. sharih

    Was ist der Sinn davon, wenn es p90 17 Sekunden sind? Da kann man genauso gut ein LLM verwenden. Das Schöne an Jev ist, dass es spottbillig und wahnsinnig schnell ist.

  3. TN1ck

    Ich habe gerade einen Durchlauf mit einem Benchmark gemacht, den ich gerade verwendet habe, um andere Modelle dagegen zu testen. (Es geht um das Erkennen von Ironie in deutschen Fußball-Tweets). Auf meinem M5 Pro mit 48GB dauerte es über 30min, um sich bei nur 100 Tweets zu entscheiden, das Denken dauert definitiv lange.

    Es schnitt deutlich schlechter ab als Jev, aber besser als andere offene Entscheidungsmodelle, die ich getestet habe (68 richtig vs. 79 richtig für Jev - siehe [1]). Ich lasse es auch für den Moderation-Benchmark laufen, aber das wird auf meiner Maschine wahrscheinlich ein paar Stunden dauern.

    [1] https://tn1ck.com/blog/jevdit

  4. itzikkatz

    Cooles Engineering, aber 17s p90-Latenz untergräbt irgendwie den Sinn eines Modells der Jev-Klasse, das eigentlich schnell und günstig sein soll. Dabei 10 Punkte auf MMLU zu verlieren, hilft auch nicht gerade.

  5. thm

    Ask Jeeves - Wir haben nur 30 Jahre gebraucht, um den Kreis zu schließen.

Mehr von diesem Tag

2026-09-29