단 하나의 레이블 없는 프롬프트로 LLM 안전 정렬을 무력화하다

GRP-Obliteration: Unaligning LLMs with a Single Unlabeled Prompt

GRP-Obliteration(GRP-Oblit)은 Group Relative Policy Optimization(GRPO)을 이용해 별도의 데이터 큐레이션 없이 단 하나의 레이블 없는 프롬프트만으로 안전 정렬된 LLM의 안전 제약을 제거하는 방법이다. 7~20B 파라미터의 instruct·reasoning 모델과 dense·MoE 아키텍처를 포함한 15개 모델에서 기존 최신 기법보다 평균적으로 더 강한 unalignment를 달성하면서도 유틸리티를 대부분 보존했고, diffusion 기반 이미지 생성 시스템에도 일반화된다.

단 하나의 레이블 없는 프롬프트만으로도 안전 정렬된 모델을 안정적으로 unalign하면서 유틸리티를 대부분 보존할 수 있음을 보인다.

이 날의 다른 글

2026-09-15