Amazon: когда LLM-судьи согласны, их мнению не стоит доверять
When LLM judges agree, should we believe them?
Исследователи Amazon предлагают метод агрегации оценок LLM-судей на основе моделей Изинга, учитывающий корреляцию между их ответами. Вместо простого подсчёта голосов или взвешенного большинства, новый подход моделирует зависимости между судьями и корректирует итоговую оценку. На трёх задачах — классификации релевантности, обнаружении токсичности и оценке суммаризации — метод показал улучшение точности на 9–14% по сравнению с взвешенным голосованием.
Восемь из десяти голосов выглядят убедительно. Но важно не только то, сколько судей согласились, а то, насколько независимо они пришли к этому согласию.