PostHogのJeeves、推論でJev型意思決定モデルの精度を0.857から0.889に向上

Jeeves. Reasoning improves Jev-like decision models

PostHogのJeeves、推論でJev型意思決定モデルの精度を0.857から0.889に向上

PostHogが公開したJeevesは、Qwen3.5-9BをベースにLoRAとポインタヘッドを組み合わせ、CISPOで訓練した推論型のJev風分類器だ。判断前に思考することで、未学習のテストデータで0.889、JevBench公開ティアで0.935を達成し、JevやKev-9Bを上回る。拡散ドラフタにより推論を最大1.76倍高速化し、Jev互換APIでyes/no・多肢選択・評価を同時に扱える。

Jev風モデルは較正された決定確率を出すが、精度は低い。そのため多くのパイプラインがフォールバックとして推論モデルに頼っている。JeevesはJev風のQwen3.5-9BをCISPOで訓練し、判断前に推論させる。
  1. HarHarVeryFunny

    Jevは必要ないと主張しようとする人々の数は、何か失うものがある人たち、つまりAnthropicやOpenAIの従業員によるステルスマーケティング以外の何ものでもない。

    好むと好まざるとにかかわらず、同じくらい安くて速いものを提供できない限り、企業はJevを使うだろう。

    以前はLLMが握っていたビジネス自動化市場のどれだけが、ここで危険にさらされているのだろうか?

  2. sharih

    これって何が目的なの?p90で17秒もかかるなら、LLMを使ったほうがまし。Jevの美点は、めちゃくちゃ安くて爆速なことなのに。

  3. TN1ck

    他のモデルをテストするのに使ったベンチマークで、さっき実行してみた。(ドイツ語のサッカーツイートの皮肉を検出するものだ)。M5 Proの48GBで、たった100ツイートを判定するのに30分以上かかった。思考には間違いなく時間がかかる。

    性能はJevよりかなり下だったが、私がテストした他のオープンな意思決定モデルよりは上だった(正解68対Jevの79正解 — [1]参照)。モデレーションベンチマークでも実行中だが、私のマシンではおそらく数時間かかるだろう。

    [1] https://tn1ck.com/blog/jevdit

  4. itzikkatz

    クールなエンジニアリングだけど、p90で17秒のレイテンシはJevクラスのモデルの意義を台無しにする。速くて安いはずのものだからね。その上MMLUで10ポイント落とすのも助けにならない。

  5. thm

    Ask Jeeves — 一周回って戻ってくるのに30年しかかからなかった。

この日のほかの記事

2026-09-29