LLM의 언어적 자기보고는 왜 보안의 기반이 될 수 없는가

The Implications of Linguistic Illegibility for LLM Security

LLM은 자연어를 생성하도록 학습되지만, 그 출력과 내부에서 추출한 언어적 특징이 모델의 실제 계산을 반영하지 못할 수 있다. 논문은 이를 '언어적 불가해성(linguistic illegibility)'이라 명명하며, 내부 연산이 활성화 공간 위의 수학으로 이뤄지는 한 이 문제는 피할 수 없다고 주장한다. 따라서 chain-of-thought 모니터링이나 헌법적 자기비판처럼 모델의 언어적 자기보고에 의존하는 보안 기법은 결코 완전할 수 없으며, taint tracking 기반 샌드박스와 견고한 가상화, 제3자 감사가 필수적인 안전 하한선을 제공한다고 제안한다.

언어적 불가해성이 항상 가능하다면, 모델의 언어적 자기보고에 의존하는 보안 메커니즘은 결코 완전할 수 없다.

이 날의 다른 글

2026-09-18