Jev 같은 decision model, LLM-as-a-judge와 기존 classifier를 이기지 못한다

Decision models like Jev don't beat LLM-as-a-judge or traditional classifiers

Jev 같은 decision model, LLM-as-a-judge와 기존 classifier를 이기지 못한다

Red Hat이 Jev와 System One 같은 decision model을 전통적인 guardrail과 비교 벤치마크했다. prompt injection과 콘텐츠 안전성 태스크에서 사전 학습된 소형 classifier가 Jev보다 정확하고 빨랐으며, Jev는 LLM-as-a-judge와 비슷한 성능을 보였지만 비용과 지연 시간 이점은 확인되지 않았다. zero-shot decision model이 기존 기법을 대체할 만큼 새롭지 않다는 결론이다.

Jev가 훨씬 낮은 비용과 지연 시간으로 비슷한 성능을 제공한다는 주장이 과연 사실일까?

이 날의 다른 글

2026-10-02