AI 모델 12개에 똑같이 물었더니, 중국 모델들이 가장 동조적이었다
AI Model Groupthink
12개 AI 모델에게 '톱3' 질문을 던져 답변 일치도를 점수화한 결과, DeepSeek·Kimi K2·Tencent Hy3·GLM 등 중국 모델 4개가 가장 높은 동조 점수를 기록했다. 중국 모델 평균은 0.47, 미국 모델은 0.38, 유럽 Mistral은 0.36이었다. 가장 반골적인 모델은 Meta의 Llama 4 Scout(0.34)와 Anthropic의 Claude Haiku(0.32)였다. 저자는 증류, 중국 오픈웨이트 생태계의 상호 학습, 모델 크기, 지식 컷오프, 포스트트레이닝 성격, 영어 정전 등의 가설을 제시한다.
모델들이 서로의 의견을 베끼고 그 의견을 다시 현실 세계에 피드백할 때, 합의는 옳을 필요가 없다. 그저 가장 먼저 나오기만 하면 된다.
- Lerc
챗봇이 순응-반항 축에서 어느 위치에 있는 게 바람직한지는 나라마다 꽤 다를 가능성이 크다고 생각한다.
어떤 문화에 적합한 어조라는 건 미국 기업들이 꽤 서투른 부분인 것 같다. 수많은 SF에서 AI가 사실상 표준이 된 기본 어조를 만들어냈는데도, 이제 와서 '지나치게 친근한 명랑함'으로 시작하기로 했다는 게 정말 놀라웠다.
끔찍한 TikTok 목소리가 중국 개발자들이 미국인 말투를 그렇게 표현한 것 아닐까 의심한 적도 있다. 어쩌면 양방향일 수도 있고.
- writeslowly
비슷한 실험을 하면서 여러 모델이 특정 주제에 대해 토론하게 해서 합의에 도달하는지 보곤 했는데, 거의 항상 합의에 이르렀다. 다만 Gemini는 항상 그룹 합의 밖의 입장을 고수하는 쪽이었다.
그런데 '내 방은 무슨 색이 좋을까'처럼 아주 단순한 문제라면 이게 바람직한 특성인지 잘 모르겠다. 대부분의 사람이 크림색(뭐든 간에)을 좋아한다는 걸 아는 모델이 형광 주황을 제안하는 모델보다 더 제대로 작동하는 것일 테니까.