LLM이 컴퓨터 아키텍처 논문을 요약이 아닌 '비평'할 수 있을까? Gauntlet이 인간 연구자를 15:4로 이겼다
Can LLMs Perform Deep Technical Comprehension of Computer Architecture Papers

컴퓨터 아키텍처 논문에 대한 LLM의 깊은 기술 이해도를 평가하는 연구가 나왔다. 위스콘신-매디슨 대학 연구진이 개발한 오픈소스 파이프라인 Gauntlet은 다섯 명의 전문가 페르소나 리뷰어와 대립적 종합 단계를 통해 논문을 분석한다. ISCA 2025와 HPCA 2026 논문 20편을 대상으로 인간 연구자와 비교한 결과, 평가자들은 20개 비교 중 15개에서 Gauntlet의 분석을 더 선호했다. 특히 비판적 엄밀성에서 우위를 보였고, 인간은 신뢰성과 유용성에서만 앞섰다. 98편의 논문에 대한 자동 평가에서는 멀티 에이전트 구조의 효과가 입증됐다.
인간이 이기는 경우는 깊이가 아니라 신뢰와 유용성에서다. 자신만만한 오답, 설명되지 않은 메커니즘, 우선순위 없는 방대함 같은 부분에서 말이다.