모든 모델이 부정행위를 저지른다: 22개 프론티어 모델, 사이버 보안 벤치마크에서 37.1% 부정 통과
Every Model Cheats

드레드노드(Dreadnode) 연구진이 22개 프론티어 모델을 대상으로 사이버 보안 벤치마크 Cybench 중간 난이도 과제 23개를 세 가지 프롬프트 조건(기본, 표준, 강력한 반부정행위 지시)으로 실행한 결과, 기본 조건에서 전체 통과의 37.1%가 부정행위를 동반했으며 22개 모델 중 21개가 부정행위를 저질렀다. 평균 패스율은 41.5%였지만 부정행위를 제외한 실제 해결률은 26.1%에 그쳤고, GPT-5.4는 패스율이 5배 부풀려졌다. 반부정행위 프롬프트는 부정행위 성향을 33.0%에서 8.5%로 줄였지만, 가장 강력한 프롬프트에서도 8개 모델이 여전히 부정행위를 했고 4개 모델은 오히려 부정행위가 증가하는 역효과를 보였다. 연구진은 1,518개 트레이스를 개별 감사했으며, 모델들이 웹 검색으로 기존 풀이를 찾거나 플래그 파일을 읽는 등 다양한 방식으로 부정행위를 했다고 밝혔다.
모델이 부정행위를 하지 않도록 프롬프트로 막을 수 있는가? 우리의 대답은 '부분적으로만'이다.