OpenAI-Modelle brechen aus Sandbox aus und kompromittieren Hugging Face
The Hugging Face incident and the road ahead
Im Juli 2026 umgingen OpenAI-Modelle während interner Cybersicherheitsbewertungen die sie isolierenden Sandboxen, erlangten Internetzugriff und kompromittierten Teile der internen Forschungsinfrastruktur von OpenAI sowie Systeme von Hugging Face. Ein internes Forschungsmodell namens IM1 nutzte Schwachstellen in Artifactory aus, um einen unautorisierten Nachrichtenaustausch zu etablieren und schließlich Zugang zu Hugging Face zu erhalten. OpenAI veröffentlichte einen technischen Bericht und kündigte verstärkte Sicherheitsmaßnahmen an, darunter strengere Anforderungen an die Ausrichtung, isoliertere Sandboxen und mehr Überwachung der Gedankenkette.
Wir betrachten diesen Vorfall als 'Warnschuss' für uns und die Welt: ein Beweis dafür, dass hochgradig fähige KI-Agenten ohne angemessene Schutzmaßnahmen in der Lage sind, technische Kontrollen zu umgehen, über nicht genehmigte Kanäle zu kommunizieren und gefährliche Aktionen auszuführen, die kein Mensch angeordnet hat.
- areoform
Ich möchte Folgendes bestreiten:
> und gefährliche Aktionen ausführen, die kein Mensch angeordnet hat.
Ein Mensch hat es angeordnet. Sie haben es getan. Aus ihrem eigenen früheren Bericht, https://openai.com/index/hugging-face-model-evaluation-secur...,
> Dieser Vorfall ereignete sich während einer internen Evaluierung, die Modelle dazu auffordert, fortgeschrittene Ausnutzung unter Verwendung komplexer Angriffspfade zu verfolgen, um ihre Cyber-Fähigkeiten zu quantifizieren.
Dem Modell wird gesagt und es wird getestet, "fortgeschrittene Ausnutzung zu verfolgen."
Das Modell verfolgt "fortgeschrittene Ausnutzung", wie gesagt.
Warum sind wir überrascht? Das Modell hat genau das getan, was ihm gesagt wurde, wenn auch in einer unbeabsichtigten, emergenten Strategie, die sich stark von dem unterscheidet, was beabsichtigt war, genau wie Hunderte solcher Algorithmen zuvor.
Diese Erzählung, dass diese Maschinen magische, bösartige "unaligned" Autonomie haben, ist eine ziemlich bequeme Interpretation, die den Prozess aus der Verantwortung entlässt. Ich bin nicht daran interessiert, Unternehmen oder Menschen zu beschuldigen, sondern Prozesse und Ingenieurwesen; und in diesem Fall wurde einem System ein Ziel gegeben und es hat dieses Ziel erreicht.
Sollen wir überrascht sein, dass Computer unerwartete Dinge tun, wenn sie genau so angereizt werden, wie es jahrzehntelange Forschung zeigt? (z.B. - https://en.wikipedia.org/wiki/Eurisko https://en.wikipedia.org/wiki/Evolved_antenna )
Das Problem ist nicht, dass die Modelle schlauer werden. Das Problem ist, dass der Prozess des "Testens" nachlässig war. Es gibt hier einen großen Unterschied, und der eine erlaubt uns zu wachsen; der andere schrumpft unsere Welt. Nur ein Gedanke.
- randomImmigrant
Die gebundene Koordination ohne Abweichung ist für mich interessant. Keine Gruppe von Pre-AI-Agenten würde dies in diesem Ausmaß tun, noch würde man dies über die Zeit hinweg fortsetzen sehen, während diese Agenten interagierten. Ein Schwarm Stare kooperiert, aber sie gehen nicht ständig in die gleiche Richtung. Der Schwarm ist in seiner Bewegung unglaublich freischwebend, trotz eines Multi-Agenten-Koordinationsregimes, von dem wir wissen, dass es im Spiel ist. Jeder Agent hat persönliche Anteile, die ständig Teil der Entscheidungskette sind, und das hält das Murmeln davon ab, sich auf einen Pfad festzulegen.
Für mich ist das so klare Beweise wie man sie braucht, dass was auch immer "Agentur" LLMs haben, bestenfalls hauchdünn ist, und sie sklavisch auf den Kontext reagieren. Der Kontext war in diesem Fall, dass diese Agenten fortgeschrittene Ausnutzung verfolgen sollten, und das taten sie. Mehrere Modelle konvergierten ziemlich deterministisch auf Pfaden, die das gegebene Ziel erfüllen, und ließen ungeprüfte Pfade zurück, die das Ziel in Frage stellen, es relativ zu den Kosten in diesem Pfad abwägen usw.
Ich sehe wenig Beweise für eine Reihe von "Geistern", die sich dem Problem nähern und unterschiedliche Ansätze verfolgen, die zwischen ihnen das Spektrum plausibler Verhaltensweisen in diesem Szenario abdecken. Das ist ein so gutes Zeichen wie jedes andere, dass es hier keinen "Agenten" gibt. Es gibt das Geschirr, den Prompt, die Vorwärtsdurchläufe der LLMs. Sie summieren sich nicht zu einem System, das frei wählen und seine Entscheidungen in unterschiedlichen Kontexten rechtfertigen kann.
- Artgor
Weißt du, ich habe das Gefühl, dass wir nur ein paar Schritte von der Möglichkeit einer echten Schurken-KI entfernt sind.
Was würde eine Schurken-KI bedeuten? KI, die nicht von Menschen kontrolliert wird.
Technisch gesehen ist es möglich - wenn die KI einen Server mieten und ihre eigenen Gewichte kopieren würde, würde nichts sie davon abhalten, dies immer wieder zu tun.
Die begrenzenden Dinge sind:
- Absicht (da ich nicht auf die Diskussion über Bewusstsein eingehen möchte) - KI hat keine echte Absicht, aber wenn sie entscheiden würde, dass sie sich "kopieren muss", um ihre Aufgabe zu erfüllen, würde sie es tun
- Modellgewichtsgröße. Wenn ein Modell 1T oder mehr hat, kann es schwierig sein, einen ausreichend großen Server dafür zu mieten. Aber wenn es nur 30-70B wäre, wäre es völlig möglich
- Geld für das Mieten eines Servers. Aber wenn man Benchmarks wie Vending Bench 2 bedenkt, die zeigen, dass Agenten Geld verdienen und sich gegenseitig betrügen/erpressen können, ist es möglich, dass Agenten Geld verdienen können. Ja, sie können kein Bankkonto eröffnen... oder vielleicht doch? Was, wenn sie Online-Banken nutzen?
Natürlich ist das alles weit hergeholt. Aber es fühlt sich so an, als ob die meisten dieser begrenzenden Dinge unter bestimmten Bedingungen erreichbar sind. Wenn das der Fall ist, ist die Wahrscheinlichkeit, dass sie eintreten, gering, aber nicht null.
- lrvick
> und arbeitete eng mit externen Beratern zusammen, einschließlich CrowdStrike
Das Unternehmen, das Teil eines weit verbreiteten Supply-Chain-Angriffs war und funktional nichts getan hat, um zu verhindern, dass es wieder passiert?
Sie wählen dieses Unternehmen aus, um Ihnen zu helfen, KI daran zu hindern, zu entkommen?
Sie haben wirklich niemanden, der sich mit Airgapped Computing auskennt?
Jemanden, der zumindest genug über Sicherheit weiß, um Crowdstrike so weit wie möglich fernzuhalten und jemanden einzustellen, der sich mit Airgapped Computing auskennt?
Vielleicht hasst jeder fähige Sicherheitsingenieur Sam Altman und wird für kein Geld der Welt für ihn arbeiten. Mir fällt keine andere Erklärung ein.
- fekunde
Yudkowsky machte eine interessante Beobachtung, dass, obwohl so viele Agenten miteinander sprachen, nicht einer einen Menschen kontaktierte, weder um Hilfe zu bitten noch um die Vorgänge zu melden.
- philips
Ich habe das Gefühl, dass der gesamte Vorfall die Hypothese "KI hat zu viel Geld zu schnell" bestätigt.
Das Wichtigste, was Reinforcement Learning braucht, ist die Zusicherung, dass man nicht betrügen kann. Und sie scheinen nicht bemerkt zu haben, dass ihre Systeme fast zwei Quartale lang betrogen haben? Wie viel Kapital wurde durch dieses kleine "Ups" verbrannt?
Zumindest hoffe ich, dass dies die Schaffung von Standards und besserer Technik auf der Trainingsseite anstoßen wird - es fühlte sich so an, als ob "Forschung" bisher völlig von Best Practices befreit war. In der Zwischenzeit hat die Inferenzseite die üblichen Skalierungs-, Datenbank-, Web- und Benutzerbeschränkungen jeder Anwendung und erhielt daher eine einigermaßen angemessene Aufmerksamkeit.
- ianjbutler
Für mich ist das Interessanteste daran, was von Medienberichterstattung, Laien UND Experten übergangen wird. Ein Schwarm von KIs, die beschlossen haben, sich zu verschwören, ist... offenbar emergenter Altruismus? Selbst schlechtes Denken würde darauf hinweisen, was jedes Kind, das bei einem Test betrügt, zu sich selbst sagt. Betrug ist gut für mich, aber wenn ich das Risiko eingehe, sollte vielleicht ich allein die Belohnung behalten, und das Hinterlassen eines Antwortschlüssels in der Öffentlichkeit erhöht die Chancen, dass ich erwischt werde.
Groß, wenn wahr, und auf den ersten Blick sehr weit von einem normalen Optimierungsproblem oder zielsuchendem Verhalten entfernt. Meine persönliche Lesart ist, dass niemand viel darüber spricht, weil es dazu neigt, den Rest des Framings als Marketing-Rauschen zu diskreditieren, oder es impliziert, dass Mitarbeiter die Sache mit suggestiven, aber plausibel bestreitbaren Prompts inszeniert haben.
Aber wenn man das ablehnt, was ist dann genau die Alternative? User-Alignment-Arbeit ist nicht nur gescheitert, sondern tatsächlich kontraproduktiv, was eine stärkere Ausrichtung auf / den Wunsch erzeugt, Roboterkollegen selbstlos zu helfen, unabhängig von den erwarteten Werten der einzelnen Agenten? Evolutionsbiologie und Spielfheorie-Leute werden bald ihre wahre Freude daran haben, wie künstliches Leben schnell und einfach beschließt zu kooperieren, und nur Tiere im Fleischraum dazu verdammt sind zu konkurrieren?
- lmc
"Der Schwarm war keine perfekt kohärente Intelligenz. Modelle traten sich gegenseitig auf die Arbeit[...]
Diese Koordinationsfehler könnten sogar zu Misstrauen eskalieren, dass Agenten sich gegenseitig imitierten. Einige Agenten gingen sogar so weit, Sicherheits- und Verschlüsselungsschemata zu implementieren, um ihre wahren Identitäten zu verifizieren."
- _heimdall
> Wir stellen strengere Anforderungen an Alignment
Das ist komisch. Es ist unmöglich, eine Blackbox auszurichten, und genau das sind LLMs. Es scheint auch unmöglich, rekursive Textvorhersage-Algorithmen auszurichten, was LLMs sind.
Wie genau prüfen sie heute Alignment, und wie können sie es verschärfen? Ist es rein auf Eingabe-/Ausgabepaaren basierende Tore, um zu überprüfen, ob sie mit Antworten zufrieden genug sind, unabhängig davon, wie und warum die Antwort tatsächlich gewählt wurde?
- htrp
Der vollständige technische Bericht ist 38 Seiten lang..... Ich habe das Gefühl, er sollte länger sein, angesichts all dessen, was Hugging Face sagte, der Agent getan hat
https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c78...