LLM이 내면을 들여다본다? '내적 상태 인식' 능력 확인
Emergent Introspective Awareness in Large Language Models

대규모 언어 모델(LLM)이 자신의 내부 상태를 성찰할 수 있는지에 대한 연구가 발표됐다. 연구진은 모델의 활성화에 알려진 개념의 표현을 주입하고, 이러한 조작이 모델의 자기 보고에 미치는 영향을 측정했다. 그 결과, 모델은 특정 시나리오에서 주입된 개념을 감지하고 정확히 식별할 수 있었으며, 이전의 내부 표현을 회상하고 원시 텍스트 입력과 구분하는 능력도 일부 보였다. 특히 Claude Opus 4와 4.1은 가장 뛰어난 성찰적 인식을 보였지만, 모델 간 경향은 복잡하고 사후 훈련 전략에 민감했다. 또한 모델이 지시나 인센티브에 따라 내부 표현을 조절할 수 있음을 발견했다. 연구진은 현재 모델이 기능적 성찰 인식을 갖추고 있지만, 그 능력은 매우 불안정하고 맥락에 의존적이라고 강조한다.
오늘날의 모델에서 이러한 능력은 매우 신뢰할 수 없고 상황에 따라 달라지지만, 모델 성능이 더욱 향상됨에 따라 계속 발전할 수 있습니다.