El modelo de recompensa deja de estar oculto: así funciona RLCD, el secreto detrás de Jev

What Is RLCD? The Secret Behind Jev

El modelo de recompensa deja de estar oculto: así funciona RLCD, el secreto detrás de Jev

RLCD combina modelado de preferencias multiway con calibración de probabilidades. En lugar de un reward model escalar escondido tras un generador, Jev expone el evaluador como interfaz: recibe estado y esquema, y devuelve distribuciones tipadas mediante Noul, Choice y Score. La calibración con Brier y temperature scaling convierte esas probabilidades en decisiones ejecutables, diferibles o escalables.

Ese es el secreto: el modelo de recompensa ya no está oculto detrás de un generador. El modelo de recompensa se convierte en el modelo.

Más de este día

2026-09-24