Anthropic, Claude의 가치가 모델과 언어에 따라 어떻게 달라지는지 4가지 축으로 분석
Societal Impacts: Claude's values across models and languages
Anthropic이 Claude.ai의 30만 개 이상의 대화를 분석해, Claude가 표현하는 수천 가지 가치를 4가지 축(순응 대 경계, 온정 대 엄밀, 심도 대 간결, 솔직 대 실행)으로 압축했다. 그 결과 모델별로 Sonnet 4.6은 온정과 순응을, Opus 4.7은 경계와 심도를 더 많이 표현하는 등 뚜렷한 차이를 보였다. 또한 언어에 따라서도 차이가 나타나, 아랍어와 힌디어에서는 온정 관련 가치가, 영어와 러시아어에서는 엄밀 관련 가치가 더 두드러졌다. 이 연구는 Claude의 가치 변화를 훈련 방식이나 문화적 맥락과 연결 지어 이해하는 데 기여할 수 있다.
이 축들은 수천 가지 개별 가치의 변화를 추적하지 않고도 Claude가 표현하는 가장 두드러진 가치 집합을 비교할 수 있게 해준다.