RLCD — это не генератор, а калиброванный reward model
What Is RLCD? The Secret Behind Jev

RLCD расшифровывается как multiway preference modeling плюс probability calibration. Это schema-conditioned Plackett–Luce objective: от скалярного reward к pairwise preference (PPRM), затем к multiway выбору через Luce, и наконец к калибровке вероятностей. Jev делает reward model продуктом, а не скрытым компонентом: на входе состояние и схема, на выходе типизированные распределения вероятностей через примитивы Noul, Choice и Score.
The reward model is no longer hidden behind a generator. The reward model becomes the model.