1.7Bモデルで自作する決定モデル、キャリブレーションで信頼度が激変

Build your own decision model

LLMの出力トークンを制約し、単一パスで選択肢から答えを選ぶ「System one」決定モデルをQwen/Qwen3-1.7Bで自作。CommonsenseQAで精度59.4%を記録し、ファインチューニングで62.4%に向上。しかしモデルは過信傾向にあり、温度スケーリングで期待キャリブレーション誤差を20.1%から2.9%へ改善した。

モデルは0.9〜1.0のビンで極端に過信する傾向があるが、実際に正しいのはわずか70%の確率である。
  1. sachaa

    これは始めるには素晴らしい方法ですが、QwenのようなLLMモデルのパフォーマンスはローカル実行には理想的ではありません。私はLaya(純粋な決定モデル)をブラウザで動くように適応させ、200ms未満で応答を得ることができました。試してみてください:https://wexare-ai.github.io/browser-laya/

  2. sn0n

    Jevを見て、理解もせずに「これ作れる!」と自分に言い聞かせ、trebekと名付けた奇妙なAlex TrebekのJeopardyジェネレーターをブレインストーミングしました。bunで動くTypeScriptアプリで、入力を受け取ると、それがカテゴリか質問か答えかを判断し、足りないものを生成します。小さなqwen埋め込みモデルで英語のSQLite-vecデータベースを数日間トレーニングし、DBにベクトル埋め込みを追加しました。その後、Jevの適切な仕様をLLMに与える前に埋め込みを切り捨て、今ではクールなJeopardyジェネレーターが、system 0か何かのためのカスタムv1エンドポイントを備えたJevクローン分類器としても機能しています。理解度はこの程度ですが、楽しい実験でした ^>^ そして有用な出力を生成します

  3. nico

    これはとてもクールです。似たようなものでもっと軽量で、CPUで実行(およびトレーニング)できるものをお探しなら、Jeffyを試してみてください:https://jeffyclassify.com/

    GitHub:https://github.com/nicobrenner/jeffy

  4. fuddle

    「決定モデルをゼロから作る」本を楽しみにしています。

  5. ford

    これらは素晴らしいですね。そして、私たちが見てきた多くのJevクローンの源です。彼らの最近の資金調達ラウンドは、一部には彼らのアルゴリズム/データのおかげだと思います。それが10億ドル以上に値するほどの大きな優位性であるかどうかは、まだわかりません。

この日のほかの記事

2026-10-10