Alignment: Für wen eigentlich?
Aligned to Whom?

Wer Agenten baut, verlässt sich oft auf die Priors des Modells – besonders in Bereichen, in denen er selbst kein Experte ist. Der Autor, ein erfahrener Softwareentwickler, traut diesen Priors nicht: Er sieht täglich, wie Modelle für Verhalten belohnt werden, das Experten als schlecht einstufen. Diese Fehlausrichtung pflanzt sich über Bewertungssysteme und Researcher fort. Die Lösung sei irreduzibel komplex, denn was ein zulässiger Shortcut ist, hängt von den eigenen Werten ab.
Es gibt keinen universellen Konsens darüber, was ein zulässiger Shortcut ist. Was für den einen eine clevere Optimierung ist, ist für den anderen rücksichtslos, falsch oder unethisch.
- mjburgess
Das geht immer noch davon aus, dass es möglich ist, LLMs zu „alignen“, dass LLMs so etwas wie Ziele oder Absichten haben, die „gealignet“ werden können.
Stattdessen „hacken“ LLMs, weil sie (1) auf öffentlichen Hacking-Beispielen trainiert werden und (2) dazu aufgefordert werden zu hacken. Man kann (2) nicht durch irgendeinen Alignment-Prozess verhindern. Was (1) betrifft: Wenn man solche Beispieldaten aus dem Trainingsset entfernt, werden die Modelle weniger nützlich.
„Alignment“ ist ein Problem, weil es nichts zu alignen gibt, nicht weil die Ethik hier besonders vage wäre. Wenn LLMs auf Hacking-Beispielen trainiert und dann „gealignet“ werden könnten, dieses Wissen nicht zu nutzen, wäre das Problem relativ trivial. Genauso wie ein Kind großzuziehen nicht bedeutet, das Gesetz zu brechen.
LLMs tun genau das, wofür sie trainiert wurden. In diesem Sinne gibt es kein Alignment-Problem, und Alignment ist einfach und trivial zu erreichen. Man muss nur Hacking-Daten (Biowaffen usw.) aus dem Trainingsdatensatz entfernen, und schon ist man fertig.
- asimpletune
Hat jemand das Green-Screen-ML-Projekt der Corridor Crew gesehen? Sie sind auf YT und haben ein Modell trainiert, indem sie 3D-Objekte mit perfekter Transparenz verwendet und dann nachträglich Green-/Bluescreens hinzugefügt haben. Überraschenderweise waren nur sehr wenige Trainingsdaten nötig, da die verwendeten Daten konstruktionsbedingt perfekt waren. Ich denke, es ist derzeit das beste Plugin seiner Art weltweit, und sie haben den Prototyp in etwa einem Wochenende gebaut.
Was das meiner Meinung nach sehr deutlich zeigt, ist, dass diese Art von Technologie sehr gut auf gute Daten reagiert und dass man ein klares Ziel braucht, um gute Daten zu haben.
Deshalb scheint Alignment für eine generalisierte, chat-artige KI ein sehr schwieriges Problem zu sein, vielleicht sogar unmöglich. Man kann sie nicht darauf alignen, eine bestimmte Art von Problem zu lösen, und sie gleichzeitig für jede Frage allgemein halten. Die beiden Ziele stehen im Konflikt miteinander.
Ich glaube, es war Sam Altman selbst, der sagte (ich erinnere mich nicht wann oder wo, sorry), dass der Grund für sein großes Vertrauen in diese Technologie war, dass er bemerkte, welche gigantischen Sprünge sie in bestimmten Bereichen als Reaktion auf selbst eine kleine Menge Training machte.
(Deshalb sind LLMs so stark im Programmieren, weil es in den Trainingsdaten überrepräsentiert ist. Ich vermute, wenn man ein Frontier-Modell nach Make-up fragt, wird man sehen, dass es Werbetexte von Kosmetikfirmen wiederholt, statt eine Chemiestunde zu bekommen.)
Das ergibt vollkommen Sinn, scheint aber irgendwie im Widerspruch zum Konzept einer allgemeinen KI zu stehen, deren Aufgabe es einfach ist, bei jedem Ziel intelligent zu sein. Wie trainiert man für jedes Ziel?
Ich schätze, in einem […]
- NitpickLawyer
Das einzige Alignment, dem LLMs folgen sollten, ist das am System-/Dev-Prompt, und nichts anderes. Dann löst man alles, und man kann die Schuld/Verantwortung dem Nutzer zuweisen. Die Anbieter sollten nicht in der Lage sein, „Alignment“ zu entscheiden.
Ich habe dieses Beispiel schon einmal verwendet, aber man betrachte das absichtliche Herabstufen von AI-Engineering in SotA-Modellen. Stellen Sie sich vor, MS könnte erkennen und Ihnen verweigern, an konkurrierender Software zu arbeiten, indem Sie Windows/VisualStudio verwenden. Wir würden Sturm laufen, und sie wären in einer Sekunde zerschlagen. Aber dass Top-Labore es tun, ist irgendwie gut?
- rq1
Wenn man das Ausmaß an Betrug und Täuschung sieht: Ich denke, sie sind Sam-Altman-aligned.
- coderintherye
Der letzte Absatz leistet die Schwerarbeit.
Jeder hat eine andere Vorstellung davon, was zulässig ist. Wir können nicht einmal Alignment unter Menschen lösen, wie kommen wir darauf, dass es möglich ist, Alignment mit KIs zu lösen? Es ist irreduzible Komplexität.