Neuralese: Warum OpenAI mit versteckten Gedanken ein Sicherheitsrisiko eingeht
What is Nueralese and Why is it Bad
Neuralese bezeichnet den Vorschlag, die natürliche Sprachkette des Denkens (Chain-of-Thought) in KI-Modellen durch lange Zahlenfolgen zu ersetzen. Das würde die Überwachung von Modellabsichten unmöglich machen. Laut Leaks könnte OpenAIs kommendes Modell Astra bereits teilweise auf Neuralese setzen. Der Artikel erklärt die Risiken und warum der Autor diesen Schritt für gefährlich hält.
Wenn der Rekursionsschritt nicht mehr in Englisch erfolgt, können wir keine Absichten mehr überwachen und nur noch durch Verhalten beobachten, ob ein Modell sicher ist.