Jev 같은 decision model, LLM-as-a-judge와 기존 classifier를 이기지 못한다
Decision models like Jev don't beat LLM-as-a-judge or traditional classifiers

Red Hat이 Jev와 System One 같은 decision model을 전통적인 guardrail과 비교 벤치마크했다. prompt injection과 콘텐츠 안전성 태스크에서 사전 학습된 소형 classifier가 Jev보다 정확하고 빨랐으며, Jev는 LLM-as-a-judge와 비슷한 성능을 보였지만 비용과 지연 시간 이점은 확인되지 않았다. zero-shot decision model이 기존 기법을 대체할 만큼 새롭지 않다는 결론이다.
Jev가 훨씬 낮은 비용과 지연 시간으로 비슷한 성능을 제공한다는 주장이 과연 사실일까?