Jev的秘密:奖励模型如何成为产品
What Is RLCD? The Secret Behind Jev

在传统的RLHF架构中,奖励模型只是训练生成器的幕后工具。Jev彻底颠覆了这一逻辑,将奖励模型直接作为产品输出。其核心RLCD技术,本质上是基于Plackett–Luce的多路偏好建模加上概率校准。通过Noul、Choice和Score三种原语,Jev不再生成文本解释,而是直接输出经过校准的决策概率分布。这意味着模型不仅告诉你哪个选项更好,还能准确量化其置信度,让软件能根据置信度决定是执行、推迟还是升级任务。
奖励模型不再隐藏在生成器背后,奖励模型本身成为了模型。