Jevのような決定モデルはLLM-as-a-judgeや従来の分類器に勝てない
Decision models like Jev don't beat LLM-as-a-judge or traditional classifiers

Red Hatが9つのガードレール手法を比較した結果、Jevなどの決定モデルは、事前学習済みの小型テキスト分類器やLLM-as-a-judgeと比べて優位性がなく、精度・レイテンシ・コストのバランスで劣ることが判明。ゼロショット分類器は既存技術の再発明に過ぎない可能性も示唆された。
Jevの発表では、Jevが同様のパフォーマンスを大幅に低いコストとレイテンシで提供すると説明されている。この主張は本当に成り立つのだろうか?