GLM-5.3-FlashをJev級の意思決定モデルに変える

Turning GLM-5.3-Flash into a Jev-like decision model

GLM-5.3-FlashをJev級の意思決定モデルに変える

LLMにJSON全体を書かせるのではなく、選択肢に番号を振ってプロンプトをchoice_index:で終わらせ、次の1トークン分のlogitsだけを読む。正規化すれば各選択肢の確率が得られ、fine-tuningなしでJev並みの精度と速度を実現する。29の公開データセットで比較すると、GLM-5.3-FlashとJevの精度差は統計的に有意ではなく、画像への型付き判断も可能になる。

私たちの核心的な洞察は、LLMにJSONオブジェクト全体を予測させる必要はないということです。なぜなら、その形はすでに分かっているからです。
  1. ricardobeat

    みんなJevをエミュレートしようとやってるけど…

    23,000語(±30k入力トークン)のランダムな本の抜粋をコンテキストとして使ってみた。それでもJevは800msで応答する。他の推定ではprefillが50〜100,000 tok/sと言われていて、普通のLLMでは明らかに不可能。Cerebrasでさえこんなに速くない。

  2. m4y0u

    私の疑問は、なぜ代わりにJevを使わないのかということだ。その方が速くて安い。

この日のほかの記事

2026-09-27