Jeeves, el modelo de PostHog que razona antes de decidir y supera a Jev en JevBench
Jeeves. Reasoning improves Jev-like decision models

Jeeves es un modelo de decisión de 9B parámetros (Qwen3.5-9B con LoRA y pointer head) entrenado con SFT y CISPO para razonar antes de responder. Alcanza 0.889 en test out-of-domain, frente a 0.857 de Jev, y 0.935 en JevBench público, frente a 0.866. Soporta preguntas de sí/no, opción múltiple y puntuación en una misma petición, con una API compatible con Jev y un drafter de difusión que acelera la generación.
Jeeves entrena un Qwen3.5-9B tipo Jev (LoRA y una pointer head) usando CISPO para razonar antes de decidir. Esto da un mejor rendimiento en tareas fuera de dominio y supera a Jev en JevBench hard (público).
- sharih
¿Cuál es el sentido de esto, si es p90 17 segundos? Bien podrías usar un LLM. Lo bonito de Jev es que es baratísimo y rapidísimo.
- HarHarVeryFunny
La cantidad de gente que siente la necesidad de intentar argumentar que no necesitas Jev solo puede ser astroturfing de aquellos que tienen algo que perder: empleados de Anthropic y OpenAI.
Nos guste o no, las empresas van a usar Jev a menos que puedas ofrecer algo igual de barato y rápido.
Me pregunto cuánto del mercado de automatización de negocios, que antes tenían los LLM, está en riesgo aquí.
- TN1ck
Acabo de hacer una prueba con un benchmark que justo usé para testear otros modelos. (Se trata de detectar ironía en tuits de fútbol alemanes). En mi M5 Pro con 48GB tardó más de 30 minutos en decidir sobre solo 100 tuits, el pensamiento definitivamente lleva tiempo.
Rindió bastante por debajo de Jev, pero por encima de otros modelos de decisión abiertos que probé (68 correctos vs 79 correctos para Jev - ver [1]). También lo estoy ejecutando para el benchmark de moderación, pero eso probablemente tomará unas horas en mi máquina.
- thm
Ask Jeeves - Solo nos tomó 30 años dar la vuelta completa.
- itzikkatz
Ingeniería genial, pero una latencia p90 de 17s medio que anula el propósito de un modelo de clase Jev, que se supone que es rápido y barato. Perder 10 puntos en MMLU en el camino no ayuda.