Amazon: когда LLM-судьи согласны, их мнению не стоит доверять

When LLM judges agree, should we believe them?

Исследователи Amazon предлагают метод агрегации оценок LLM-судей на основе моделей Изинга, учитывающий корреляцию между их ответами. Вместо простого подсчёта голосов или взвешенного большинства, новый подход моделирует зависимости между судьями и корректирует итоговую оценку. На трёх задачах — классификации релевантности, обнаружении токсичности и оценке суммаризации — метод показал улучшение точности на 9–14% по сравнению с взвешенным голосованием.

Восемь из десяти голосов выглядят убедительно. Но важно не только то, сколько судей согласились, а то, насколько независимо они пришли к этому согласию.

Ещё за этот день

2026-09-14