RLCD — это не генератор, а калиброванный reward model

What Is RLCD? The Secret Behind Jev

RLCD — это не генератор, а калиброванный reward model

RLCD расшифровывается как multiway preference modeling плюс probability calibration. Это schema-conditioned Plackett–Luce objective: от скалярного reward к pairwise preference (PPRM), затем к multiway выбору через Luce, и наконец к калибровке вероятностей. Jev делает reward model продуктом, а не скрытым компонентом: на входе состояние и схема, на выходе типизированные распределения вероятностей через примитивы Noul, Choice и Score.

The reward model is no longer hidden behind a generator. The reward model becomes the model.

Ещё за этот день

2026-09-24