Jevの正体はRLCDだった — 報酬モデルが製品になる仕組み
What Is RLCD? The Secret Behind Jev

Jevは言語モデルの代替ではなく、報酬モデリングの次の段階だ。RLCDはスキーマ条件付きPlackett–Luce目的関数で、ペアワイズ選好を多方向選好に拡張し、確率較正を加える。JevはNoul、Choice、Scoreという型付き出力と並列推論でこれを製品化。報酬モデルは生成器の裏に隠れず、モデルそのものになる。
その秘密とは、報酬モデルがもはや生成器の背後に隠れていないということだ。報酬モデルがモデルになる。
- firejake308
> 運用上のシグナルは常に相対的な選好だった。スカラーはそれをただ隠していただけだ。
これはまたClaude特有の言い回しなのか?「Xは常にYだった。Zはそれをただ隠していただけだ。」それとも俺が大げさに捉えすぎているのか?
- WalterGR
RLCDは、記事では定義されていないが、Reinforcement Learning for Calibrated Decisions(較正された意思決定のための強化学習)のことだ。
- daemonk
そう、実際のところ、素早く小さな意思決定をするのに役立つのは、まさにこの較正なんだよな。LLMに問題のスコアを出させると、気まぐれに変わる一貫性のないスケールやアンカーの結果が返ってくる。
このブログは統計色がかなり強い。時間があるときにちゃんと読み込まないと。これは要するに、結果をブートストラップして統計的に答えを正規化しているってことなのか?