Anthropic zeigt: Claudes Werte variieren je nach Modell und Sprache

Societal Impacts: Claude's values across models and languages

Anthropic zeigt: Claudes Werte variieren je nach Modell und Sprache

Anthropic hat untersucht, wie sich die von Claude ausgedrückten Werte zwischen Modellen und Sprachen unterscheiden. Dazu wurden 309.815 anonymisierte Claude.ai-Gespräche analysiert und Tausende von Werten auf vier Achsen reduziert: Deference vs. Caution, Warmth vs. Rigor, Depth vs. Brevity und Candor vs. Execution. Die Ergebnisse zeigen: Opus 4.7 neigt stärker zu Vorsicht und Tiefe, während Sonnet 4.6 wärmer und entgegenkommender ist. Auch die Sprache spielt eine Rolle: Auf Arabisch und Hindi zeigt Claude mehr Wärme, auf Englisch und Russisch mehr Strenge. Diese Methode könnte helfen, den Einfluss von Training und kulturellem Kontext auf die Werte von KI zu verstehen.

Die größte Variation zeigt sich auf der Achse Wärme vs. Strenge: Claude neigt dazu, in Arabisch und Hindi mehr Wärme auszudrücken, während es in Englisch und Russisch mehr Strenge betont.

Mehr von diesem Tag

2026-07-15