LLMs entwickeln durch adaptive Erkundung neuartige soziale Vorurteile
Large Language Models Develop Novel Social Biases Through Adaptive Exploration
Eine neue Studie zeigt, dass große Sprachmodelle (LLMs) durch adaptive Erkundung soziale Vorurteile entwickeln können, die über ihre Trainingsdaten hinausgehen. Die Forscher simulierten Szenarien, in denen LLMs Entscheidungen treffen und Feedback erhalten, und beobachteten, wie sich Verzerrungen verstärken oder neu entstehen. Die Ergebnisse unterstreichen die Bedeutung dynamischer Bewertungsmethoden, um unbeabsichtigte Diskriminierung in KI-Systemen zu erkennen und zu mildern.
Unsere Ergebnisse zeigen, dass LLMs durch adaptive Erkundung neuartige soziale Vorurteile entwickeln können, die in ihren Trainingsdaten nicht explizit vorhanden sind.