AI가 쓴 글, 단어가 아닌 구조만으로 98% 정확도로 잡아낸다
Training a model to identify AI-generated web content from structure alone
단어 기반 AI 탐지기는 거의 완벽하지만 표현을 바꾸면 쉽게 무력해진다. 연구진은 268개 기업 도메인의 ChatGPT 이전 인간 블로그 글 2,250개와 5개 프런티어 모델이 생성한 AI 미러 11,250개를 비교했다. 214개 특징 도구로 AI 글을 구조적 특징 187개만으로 98.0 macro-F1으로 탐지했고, AI 글이 재작성된 후에도 98.1을 유지했다. AI 글은 79.3%가 올바른 모델로 귀속됐다(우연 확률 16.7%).
AI 글은 정돈되고 스스로를 드러내는 형태를 공유하며, 79.3%가 올바른 출처로 귀속된다 — 우연 확률 16.7%에 대비되는 수치다.