Jev не обходит LLM-as-a-judge и традиционные классификаторы

Decision models like Jev don't beat LLM-as-a-judge or traditional classifiers

Jev не обходит LLM-as-a-judge и традиционные классификаторы

Red Hat сравнила 9 guardrail-решений: предобученные классификаторы, BART-large-mnli, LLM-as-a-judge и decision-модели вроде Jev. В тестах на prompt injection и токсичность Jev показал точность 86,35% и 348 мс задержки, уступив Qwen3.6-35B (89,31%) и DeBERTa (89,01%, 54 мс). Вывод: специализированные классификаторы остаются быстрее и точнее, а заявления о превосходстве Jev не подтверждаются.

В домене AI guardrails, где существует множество размеченных датасетов для различных рисков, это изобилие данных означает, что вы можете легко и дешево обучить классификаторы для обнаружения рисков.

Ещё за этот день

2026-10-02