DeepMind 25,000달러 Kaggle 대상 수상작, '노골적인 AI 슬롭' 논란에 휩싸이다
Blatant AI slop just won a 25k USD DeepMind Kaggle Grand Prize
Google DeepMind가 주최한 'Measuring Progress Toward AGI' 해커톤에서 25,000달러의 대상 수상작 중 하나인 MEDLEY-BENCH가 참가자 Thomas Werkmeister의 공개 비판으로 논란에 휩싸였다. Werkmeister는 수상작의 평가 과정과 결과의 신뢰성에 심각한 결함이 있다고 주장한다. 구체적으로, 수상팀이 SDK를 제대로 활용하지 않아 데이터 수집 과정을 투명하게 공개하지 않았고, 제시된 그래프를 잘못 해석하여 핵심 통찰을 도출했으며, 이후 같은 논문에서 자신들의 주장과 모순되는 결과를 보고했다고 지적한다. 또한, 네 가지 능력이 거의 완벽한 상관관계를 보인다는 발견은 서로 다른 능력을 측정한다는 전제 자체를 약화시킨다고 주장한다.
그들은 자신들의 그래프조차 제대로 읽지 못하고 터무니없이 틀린 진술을 하고, 그 잘못된 해석을 바탕으로 '핵심 통찰'이라는 터무니없는 추측을 내세운 뒤, 몇 문단 뒤에는 그 핵심 통찰과 모순되는 결과를 발표한다.