Los modelos de decisión como Jev no superan a LLM-as-a-judge ni a los clasificadores tradicionales

Decision models like Jev don't beat LLM-as-a-judge or traditional classifiers

Los modelos de decisión como Jev no superan a LLM-as-a-judge ni a los clasificadores tradicionales

Red Hat evaluó nueve guardrails para inyección de prompts y seguridad de contenido. Los clasificadores preentrenados de 200M parámetros lograron 89% de precisión con 54 ms de latencia, mientras que Jev alcanzó 86% pero con 348 ms. Qwen3.6-35B igualó la precisión con latencia aún mayor. Los modelos de decisión no ofrecen ventajas claras frente a alternativas más simples y eficientes.

Es razonable cuestionar si el enfoque de TypeSafe es realmente tan novedoso como se afirma.

Más de este día

2026-10-02