JevBench v1.3.0が52モデルを格付け、Jev 1.13.0が首位

Show HN: JevBench, a reproducible benchmark for typed decision models

JevBench v1.3.0が52モデルを格付け、Jev 1.13.0が首位

Benchmark Heavenが独自に構築したJevBench v1.3.0は、型付き意思決定モデル52システムを534の意思決定(うち220の難問)で評価し、Intelligence・Calibration・Speed・Costを各25%の幾何平均でスコア化した。首位はJev 1.13.0(74.4)、2位はSemIf(Qwen3.5-4B、73.1)、3位はdjev(Maisa、73.0)。結果はテスト構成を反映し、全アプリケーションを代表するものではない。

JevBenchはBenchmark Heaven自身のベンチマークであり、Jevクラスの意思決定モデル向けに、状態と限定されたルーブリックを入力し、型付きの回答を出力する。
  1. hbrn

    $40mの資金調達、2年間のステルス。

    数日で作られ、どうやらファインチューニングなしの生のQwenを使っているらしいSemIfと同等の性能。SemIfはなんとブラウザで動く。しかもJevは2倍のコスト?

    Jevが一貫して自分をQwenだと思っているのは驚きか?

    Jevは詐欺だとほぼ確信している。Qwenを持ってきて少しファインチューニングし、投資家に$10mかかったと言い、$1mを広告に費やし、利益を得る。

  2. ks2048

    ここでのテストが正確に何なのかを解明しようとしていた。いくつかの質問を見つけたと思う(ここ:https://github.com/fstandhartinger/jevbench/blob/main/datase...

    例えば、

    "instructions": "ユーザーのメッセージはどの意図を表現していますか?",

    "labels":["set_alarm", "play_music", "weather", "send_message", "turn_off_lights"],

    "state": "Taylor Swiftをかけて。",

    "expected": "play_music"

  3. dmix

    バイブコーディングされたウェブサイトは、プロンプトやコミットスタイルのコメントを視覚的なコンテキストで伝える代わりに(あるいは単に除外する代わりに)、文字通りのインターフェースに含めていることで見分けられる

    > 任意の列でソート; 実行が生成できなかった値は常に最後にソートされます。コストにホバーすると価格設定方法、レイテンシにホバーするとエンドポイントが表示されます。名前は各プロジェクトにリンクします。

    デザイナーは決してこれを書かないだろうが、LLMはインターフェースの隣に小さな灰色のテキストを作ることで、愚かなコードコメントと同じように、これをただ挿入する。

この日のほかの記事

2026-09-22