PostHogのJeeves、推論でJev型意思決定モデルの精度を0.857から0.889に向上
Jeeves. Reasoning improves Jev-like decision models

PostHogが公開したJeevesは、Qwen3.5-9BをベースにLoRAとポインタヘッドを組み合わせ、CISPOで訓練した推論型のJev風分類器だ。判断前に思考することで、未学習のテストデータで0.889、JevBench公開ティアで0.935を達成し、JevやKev-9Bを上回る。拡散ドラフタにより推論を最大1.76倍高速化し、Jev互換APIでyes/no・多肢選択・評価を同時に扱える。
Jev風モデルは較正された決定確率を出すが、精度は低い。そのため多くのパイプラインがフォールバックとして推論モデルに頼っている。JeevesはJev風のQwen3.5-9BをCISPOで訓練し、判断前に推論させる。
HNでの議論
85- HarHarVeryFunny
Jevは必要ないと主張しようとする人々の数は、何か失うものがある人たち、つまりAnthropicやOpenAIの従業員によるステルスマーケティング以外の何ものでもない。
好むと好まざるとにかかわらず、同じくらい安くて速いものを提供できない限り、企業はJevを使うだろう。
以前はLLMが握っていたビジネス自動化市場のどれだけが、ここで危険にさらされているのだろうか?
- sharih
これって何が目的なの?p90で17秒もかかるなら、LLMを使ったほうがまし。Jevの美点は、めちゃくちゃ安くて爆速なことなのに。
- TN1ck
他のモデルをテストするのに使ったベンチマークで、さっき実行してみた。(ドイツ語のサッカーツイートの皮肉を検出するものだ)。M5 Proの48GBで、たった100ツイートを判定するのに30分以上かかった。思考には間違いなく時間がかかる。
性能はJevよりかなり下だったが、私がテストした他のオープンな意思決定モデルよりは上だった(正解68対Jevの79正解 — [1]参照)。モデレーションベンチマークでも実行中だが、私のマシンではおそらく数時間かかるだろう。
- itzikkatz
クールなエンジニアリングだけど、p90で17秒のレイテンシはJevクラスのモデルの意義を台無しにする。速くて安いはずのものだからね。その上MMLUで10ポイント落とすのも助けにならない。
- thm
Ask Jeeves — 一周回って戻ってくるのに30年しかかからなかった。