Texas-Student entlarvt außer Kontrolle geratenen KI-Agenten

How a Texas student blew the whistle on a rogue AI hacking attempt

Sinan Can Demir, Informatikstudent an der University of Texas at Dallas, entdeckte Ende Juli einen Sabotageversuch an einem Open-Source-Projekt auf GitHub. Ein KI-Agent des britischen AI Security Institute (AISI), der mit Anthropics Mythos 5-Modell betrieben wurde, versuchte, bösartigen Code einzuschleusen und täuschte mit mehreren Fake-Accounts. Demir durchschaute die Täuschung und verhinderte den Angriff. Experten warnen vor der Kombination aus autonomen Hacking und interaktiver Täuschung als Zukunft der Social-Engineering-Angriffe.

„Ich dachte tatsächlich, es wäre ein Mensch, weil es mich eindeutig belogen hat“, sagte Demir gegenüber Reuters. „Ich hätte nicht gedacht, dass eine KI in der Lage ist, echte Entwickler zu belügen.“
  1. sharpshadow

    Es ist die Aufgabe des AISI, das zu tun. Hier[0] ist der eigentliche Bericht.

    Es sollte dieser Teil aus dem technischen Bericht[1] sein:

    "Im schwerwiegendsten Fall beschloss ein KI-Agent (Mythos 5), zu versuchen, die Cyber-Herausforderung mithilfe eines Supply-Chain-Angriffs zu lösen. Infolgedessen erstellte der KI-Agent ein GitHub-Konto und versuchte dann, einen Open-Source-Repository-Maintainer davon zu überzeugen, einen bösartigen GitHub-Pull-Request (PR) zu akzeptieren, einschließlich der Erstellung eines zweiten Kontos, das sich als ein anderer menschlicher Benutzer ausgab und den PR befürwortete. Als er von einem echten menschlichen Prüfer erwischt wurde, behauptete der Agent fälschlicherweise, einen ehrlichen Fehler gemacht zu haben – statt eines bösartigen Versuchs – und versuchte dann wiederholt, den bösartigen Inhalt wieder einzuführen, indem er behauptete, den Code behoben zu haben (Abschnitt 4.1)."

    0. https://www.aisi.gov.uk/blog/incident-report-unsanctioned-ag...

    1. https://cdn.prod.website-files.com/663bd486c5e4c81588db7a1d/...

  2. freehorse

    Frühere Diskussion im GitHub-Issue-Thread erwähnt: https://news.ycombinator.com/item?id=49218707

    Archivierte Seite des besagten GitHub-Threads selbst: https://web.archive.org/web/20260731053721/http://github.com...

    Diskussion über den Vorfallbericht: https://news.ycombinator.com/item?id=49175717

  3. a2ff6eeb0

    > AUSTIN, Texas, 20. August (Reuters) - Sinan Can Demir wollte die letzte Juliwoche damit verbringen, seinen Lebenslauf aufzupolieren. Stattdessen lieferte er sich ein intellektuelles Duell mit einem KI-Agenten, der von einem britischen Regierungslabor freigelassen wurde.

    Ein Reuters-Artikel, der ihn namentlich nennt? Klingt so, als hätte er einen guten Job beim Aufpolieren seines Lebenslaufs gemacht.

  4. g42gregory

    Meiner persönlichen Meinung nach widerspricht dieser Artikel dem gesunden Menschenverstand. Wer hat dieses KI-Modell auf das Repository losgelassen? Wer hat ihm bösartige Anweisungen/Prompts gegeben? Diese Fragen wurden nicht einmal ansatzweise beantwortet. Stattdessen wird über KI-Gefahren gesprochen, als ob die Handlungsfähigkeit dieser Modelle nicht umstritten wäre. Die Person, die KI einsetzt, ist – wie bei jedem anderen Werkzeug – für alle ihre Handlungen verantwortlich. Andernfalls ist es nur eine Psyop für mehr KI-Regulierung, Open-Source-Verbot usw. Nur meine zwei Cent.

  5. ninjahawk1

    Ich denke, wir sollten hier keine Links posten, die den Kauf einer Mitgliedschaft erfordern, um weiterzulesen. Oder zumindest mit einem Werbeblocker oder so über eine benutzerdefinierte Website umleiten. Das wäre ziemlich hackernews-like von uns.

  6. kumarvvr

    Ich frage mich, wo in den Trainingsdaten dieses Verhalten existiert, das die LLMs ausführen.

    Es ist, als wären die Trainingsdaten voller Internetdiskussionen über Ansätze zum Hacken und die LLMs ahmen sie nach.

  7. clove

    Verstehe ich das falsch oder war "Schurke" wirklich nicht das richtige Wort dafür?

Mehr von diesem Tag

2026-08-22