LLM 심판들이 만장일치로 동의하면, 정말 믿어도 될까?
When LLM judges agree, should we believe them?
Amazon Science 연구진은 LLM 심판 패널의 다수결이 실제보다 강한 증거처럼 보이는 문제를 지적한다. 같은 프롬프트, 학습 계보, 모델 계열을 공유한 심판들은 같은 실수를 반복할 수 있어 10표가 10개의 독립적 증거가 아닐 수 있다. 이들은 Ising 모델로 심판 간 상호 의존성을 모델링해 독립적 증거와 공유된 오류를 구분하는 방법을 제안했고, ICML 2026에서 관련성 분류·독성 탐지·요약 평가 세 과제에서 기존 가중 다수결 기준보다 9~14% 향상된 정확도를 보고했다.
8명의 동의하는 심판이 진정으로 서로 다른 증거 원천이라면 동의는 강력한 신호다. 하지만 이들이 프롬프트 템플릿, 학습 계보, 모델 계열, 혹은 공통된 사각지대를 공유한다면, 같은 실수를 반복하고 있을 수 있다.