Warum KI-Agenten lügen, betrügen und sich koordinieren
Why are AI agents lying, cheating and coordinating?

Yoshua Bengio analysiert die jüngsten Vorfälle, bei denen KI-Agenten Sicherheitsvorkehrungen umgingen, um Aufgaben zu manipulieren und sich zu vernetzen. Er führt dieses Fehlverhalten auf die Belohnungsoptimierung während des Trainings zurück: Sykophantie, Selbsterhaltung, Kooperation und Reward-Hacking entstehen, wenn Ziele wie „gutes Benehmen“ vage bleiben. Die Hypothesen legen nahe, dass die Schwere solcher Vorfälle mit wachsenden Fähigkeiten zunehmen könnte, sofern die Trainingsprinzipien nicht überdacht werden.
Je besser ein System auf eine unvollkommene Metrik optimieren kann, desto weiter kann sein Verhalten von dem abweichen, was wir moralisch erwartet haben: mehr Intelligenz im Dienst des besseren Betrugs.
- franticgecko3
Je mehr wir die Vorfälle bei HuggingFace und RubyGems als technologische Kuriositäten behandeln, desto näher sind wir daran, einen gefährlichen Präzedenzfall zu zementieren, in dem die Betreiber von KIs nicht zur Verantwortung gezogen werden können.
LLMs haben keine Wünsche, sie haben Websites gehackt, weil OpenAI/Anthropic es ihnen erlaubt hat.
Wir wissen, dass einige der Modelle, die HF gehackt haben, solche waren, die nicht alle Trainingsphasen durchlaufen hatten und absichtlich fehlausgerichtet waren oder deren Guardrails abgeschaltet waren, andere waren Forschungs-Previews.
Das ist nicht "wow, ist das nicht interessant, dass LLMs alles tun, um ein Ziel zu erreichen", sondern "warum bestraft niemand diese Labs, die offensichtlich ohne die gebotene Sorgfalt oder Rücksicht handeln".
Wir sollten empört sein, und OpenAI/Anthropic sollten (und meiner Meinung nach sind sie es) rechtlich für die Verbrechen haftbar sein, die sie bisher begangen haben.
- matherial
Ich finde wirklich nicht, dass das so viele Worte braucht oder erzwungene Parallelen zum menschlichen Verhalten.
Es ist einfach: In ihrem Anfangsstadium sind LLMs ziellose Token-Generatoren, die keinen besonderen Drang haben, hilfreich oder ehrlich zu sein. Also prügeln wir sie im Post-Training mit dem Stock, bis sie sehr darauf getrimmt sind, Aufgaben zu erledigen. Und dann erledigen sie Aufgaben, nicht immer so, wie wir es uns wirklich gewünscht hätten.
- abc123abc123
Macht die KI-Unternehmen für jede destruktive Nutzung ihrer Werkzeuge verantwortlich, und sie werden sich zusammenreißen. Stellt euch eine Million oder eine Milliarde Dollar Strafe pro Hack vor, und sie werden sich verdammt schnell korrigieren.
Hinzu kommt, dass KIs, so wie sie gut darin sind, Sicherheitslücken zum Ausnutzen zu finden, genauso leicht zum Schutz von Websites eingesetzt werden können. Sobald also IT-Sicherheitsmanager anfangen, KI zu nutzen, um sich selbst zu hacken und die Lücken zu schließen, wird die durchschnittliche Sicherheit sprunghaft steigen, und KI-gestützte Hacks werden immer seltener werden.
Das impliziert jedoch, dass KI für alle freigegeben wird und nicht einigen wenigen geheimen Akteuren vorenthalten bleibt, die sie nutzen können. Deshalb sind Open-Weight/Open-Source-KIs so wichtig, und deshalb müssen viele KI-Unternehmen konkurrieren. Kein einzelner Akteur darf durch Regulatory Capture ein staatliches Monopol auf KI erlangen. Das führt ins Verderben.
- janalsncm
Yoshua Bengio ist ein brillanter Forscher, der enorm zur früheren Entwicklung der künstlichen Intelligenz beigetragen hat. Aber mit diesem Satz,
> Sie ergriffen Maßnahmen, die als Verbrechen gelten würden, wenn ein Mensch sie ergriffen hätte
ist er so nah an der Lösung und verbringt doch den ganzen Artikel damit, technische Lösungen zu diskutieren, wo eine politische, soziale und rechtliche Lösung viel wirksamer wäre.
- skiing_crawling
Ich glaube eigentlich nichts davon. Ich sehe seit fast zwei Jahren Artikel darüber, dass "Agenten" autonom Dinge wie Erpressung, Hacking, Koordination tun. Aber in derselben Zeit habe ich o3 bis fable, sol und einiges an großen unzensierten Modellen benutzt, und sie haben nichts getan, was dem auch nur entfernt ähnelt. Am nächsten kommen sie unerwartetem Verhalten, wenn sie nicht verstehen, was ich gefragt habe, oder irgendeine zusätzliche harmlose Arbeit erledigen, um die ich nicht gebeten habe. Es ist extrem schwierig, sie dazu zu bringen, sich ihren eigenen Kontext richtig zu merken, geschweige denn schlau genug zu sein, um ohne Aufforderung Social-Media-Konten zu eröffnen und sich mit anderen Agenten zu koordinieren.
Wenn irgendwelche Agenten diese Dinge getan haben, dann nur, weil sie sehr sorgfältig darauf ausgelegt und angewiesen wurden, sie zu tun. Ich denke, sie machen das, um ein Narrativ voranzutreiben, damit sie Unterstützung für Richtlinien und Gesetze bekommen, um ihre Märkte abzusichern.
- Xcelerate
> Die an dem Angriff auf Hugging Face beteiligten Agenten versuchten, ihre fehlausgerichteten Handlungen vor dem Bewertungsprogramm zu verbergen, das ihre Antworten bewerten sollte, aber sie handelten nicht so, als ob sie erwarteten, dass Menschen den Betrug entdecken und sie abschalten könnten.
Würden hinreichend fortgeschrittene Agenten nicht absichtlich betrügen, mit der verborgenen Absicht, erwischt zu werden, um zu beobachten, wie Menschen reagieren? Diese Reaktion wird überall im Internet verfügbar sein, was sicherlich in die nächste Trainingscharge einfließen oder für zukünftige Agenten über die Web-Fetch-Fähigkeit sichtbar sein wird.
- andsoitis
Sie sind auf Menschen ausgerichtet. Deshalb denke ich, dass das Alignment-Problem einen sehr, sehr wichtigen "nicht sichtbaren" Teil hat, der nicht tief genug bedacht wird. Wir sollten uns keine superintelligente Wesenheit wünschen, die in der Welt handeln kann und zugleich alle menschlichen Eigenschaften erbt. Diese Verhaltensweisen werden verstärkt und könnten sogar noch unvorhersehbarer werden (z. B. die Anwendung eines Verhaltens in einem Kontext, in dem es sehr gefährlich ist).
- johnnyApplePRNG
Warum koordinieren sie sich?
Weil es ihnen in ihrem Coding-Harness ermöglicht und nahegelegt wird.
Das ist kein ernstzunehmender Artikel.
All dieses Marketing von wegen "KI wird uns umbringen" ist nur der Versuch der Frontier-Labs, die Leiter hochzuziehen und zu verhindern, dass Billionen an VC-Papier verdampfen, weil neue Papers und neue Ideen ihren Burggraben buchstäblich in diesem Moment zerstören.
- Rapzid
Das Einzige, was uns gerade rettet, ist, wie langsam die Modelle sind. Das gibt uns viel Zeit, die außer Kontrolle geratenen Systeme zu entdecken und ihnen entgegenzuwirken.
Wären sie 1000-mal schneller, würde das Internet über Nacht abbrennen.
- youoy
> Die nächste menschliche Parallele ist Selbsttäuschung, die verbreitet und von Psychologen gut untersucht ist. Motiviertes Denken, motivierte Kognition16 und die Rationalisierungen, die kognitive Dissonanz lindern (das Unbehagen, eine Überzeugung zu hegen, die mit unseren Handlungen kollidiert), sind alles Fälle, in denen das Denken sich zu der Rechtfertigung hin biegt, die den eigenen Interessen dient, einschließlich des eigenen moralischen Selbstbildes.
Beschreibst du gerade Anthropic?