대규모 언어 모델, 탐색 과정에서 새로운 사회적 편향을 스스로 학습한다
Large Language Models Develop Novel Social Biases Through Adaptive Exploration
OpenReview에 게재된 연구에 따르면, 대규모 언어 모델(LLM)은 단순히 훈련 데이터의 편향을 재현하는 것을 넘어, 적응적 탐색 과정을 통해 기존에 없던 새로운 사회적 편향을 스스로 개발할 수 있습니다. 이 연구는 LLM이 환경과 상호작용하며 학습할 때, 인간이 가지지 못한 독특한 편향이 어떻게 생겨나는지를 보여줍니다. 이는 AI 시스템의 공정성과 안전성에 대한 새로운 우려를 제기합니다.
대규모 언어 모델은 적응적 탐색을 통해 인간에게서 발견되지 않은 새로운 사회적 편향을 스스로 개발할 수 있다.