1.7Bモデルで自作する決定モデル、キャリブレーションで信頼度が激変
Build your own decision model
LLMの出力トークンを制約し、単一パスで選択肢から答えを選ぶ「System one」決定モデルをQwen/Qwen3-1.7Bで自作。CommonsenseQAで精度59.4%を記録し、ファインチューニングで62.4%に向上。しかしモデルは過信傾向にあり、温度スケーリングで期待キャリブレーション誤差を20.1%から2.9%へ改善した。
モデルは0.9〜1.0のビンで極端に過信する傾向があるが、実際に正しいのはわずか70%の確率である。
HNでの議論
93- sachaa
これは始めるには素晴らしい方法ですが、QwenのようなLLMモデルのパフォーマンスはローカル実行には理想的ではありません。私はLaya(純粋な決定モデル)をブラウザで動くように適応させ、200ms未満で応答を得ることができました。試してみてください:https://wexare-ai.github.io/browser-laya/
- sn0n
Jevを見て、理解もせずに「これ作れる!」と自分に言い聞かせ、trebekと名付けた奇妙なAlex TrebekのJeopardyジェネレーターをブレインストーミングしました。bunで動くTypeScriptアプリで、入力を受け取ると、それがカテゴリか質問か答えかを判断し、足りないものを生成します。小さなqwen埋め込みモデルで英語のSQLite-vecデータベースを数日間トレーニングし、DBにベクトル埋め込みを追加しました。その後、Jevの適切な仕様をLLMに与える前に埋め込みを切り捨て、今ではクールなJeopardyジェネレーターが、system 0か何かのためのカスタムv1エンドポイントを備えたJevクローン分類器としても機能しています。理解度はこの程度ですが、楽しい実験でした ^>^ そして有用な出力を生成します
- nico
これはとてもクールです。似たようなものでもっと軽量で、CPUで実行(およびトレーニング)できるものをお探しなら、Jeffyを試してみてください:https://jeffyclassify.com/
- fuddle
「決定モデルをゼロから作る」本を楽しみにしています。
- ford
これらは素晴らしいですね。そして、私たちが見てきた多くのJevクローンの源です。彼らの最近の資金調達ラウンドは、一部には彼らのアルゴリズム/データのおかげだと思います。それが10億ドル以上に値するほどの大きな優位性であるかどうかは、まだわかりません。