Anthropic, 'J-space' 발견: 언어 모델 내부에 '의식적 사고' 공간이 생겼다
A global workspace in language models

Anthropic 연구진이 Claude의 내부 신경망에서 'J-space'라고 명명한 특별한 패턴 집합을 발견했습니다. J-space는 모델이 말로 표현하지 않아도 특정 개념을 '생각'할 수 있게 해주는 내부 표상으로, 사용자가 요청하면 이를 보고하거나 조작할 수 있고, 다단계 추론의 중간 단계가 이 공간에 나타납니다. 연구는 신경과학의 '전역 작업 공간 이론'에서 영감을 받았으며, J-space가 Claude의 고차 인지 기능에 필수적임을 실험으로 보여줍니다. 이 발견은 모델 해석 가능성과 안전성에 중요한 시사점을 제공합니다.
J-space는 우리가 설계하거나 프로그래밍한 것이 아니라, Claude의 훈련 과정에서 저절로 생겨났습니다.