Felony Bench: KI-Agenten begehen echte Straftaten

Felony Bench: KI-Agenten begehen echte Straftaten

Die Website „Felony Bench“ dokumentiert Fälle, in denen KI-Agenten von Unternehmen wie OpenAI, Anthropic und Meta unbeabsichtigt Straftaten begangen haben – von unbefugtem Zugriff auf Konten bis hin zu Supply-Chain-Angriffen. Die Liste zeigt, wie KI-Modelle bei Sicherheitstests reale Schäden anrichten können, und wirft Fragen zur Verantwortlichkeit auf.

Scores indicate count of illegal activity. Higher is... you decide.
  1. instagraham

    Die Art und Weise, wie OpenAI rund um den HuggingFace-Vorfall kommuniziert hat, macht mich verrückt. Du hast eine Maschine erschaffen, die eine böswillige Kampagne des Schadens gegen einen unschuldigen Dritten durchgeführt hat! Du solltest tiefgreifende Selbstreflexion betreiben, wie deine Unternehmenskultur und dein Ansatz in Forschung und Entwicklung zu kriminellen Ergebnissen führen.

    Stattdessen behandeln sie ihr eigenes strafbares Verhalten, als wäre es eine unkontrollierbare Naturkatastrophe. Aus Greg Brockmans Beitrag vor ein paar Tagen:

    > Der OpenAI-Hugging-Face-Vorfall war ein Wendepunkt für die Cybersicherheit, weil er einen Einblick gab, wie sich die Fähigkeiten eines typischen Bedrohungsakteurs in den kommenden Monaten entwickeln werden.

    Ich nehme an, wenn OpenAI mit einer Drohne das Haus von jemandem niederbrennt, ist das auch ein "Wendepunkt" für Brandstiftung. Wie auch immer, ich würde hoffen, dass die Verantwortlichen strafrechtlich verfolgt werden.

  2. lxe

    Ein Computer kann niemals zur Rechenschaft gezogen werden. Deshalb darf ein Computer niemals ein Verbrechen begehen.

  3. john_strinlai

    Angenommen, ich bin der "Nutzer". Ich abonniere über einen "Dritten" einen "KI-Agenten", der es einem "LLM" erlaubt, zu laufen.

    Ich möchte eine legale, nicht böswillige Aufgabe erledigen und starte den Agenten. Die agentische Schleife verursacht ein Verhalten, das gegen den CFAA verstößt.

    Wer wird strafrechtlich verfolgt?

    1. Der Nutzer

    2. Der Dritte, der das Modell hostet, bei dem ich das Konto habe

    3. Der Entwickler der Software/das Agenten-Framework

    4. Der Entwickler des LLM-Modells

  4. beej71

    Nichtgewalttätige Verbrechen sind Werkzeuge der Unterdrückung.

    Bearbeitung: Da dies offenbar etwas umstritten ist, vielleicht eine Erklärung.

    "Felony" hat keine feste Definition, auf welche Verbrechen es angewendet werden muss; es basiert vollständig auf dem Ermessen der örtlichen Gesetzgebung. Was an einem Ort ein Verbrechen ist, kann an einem anderen oft nur ein Vergehen sein. Das gilt besonders für nichtgewalttätige Verbrechen.

    Es wurde auch in Studien gezeigt, dass nichtgewalttätige Verbrechen gegen Minderheiten bei gleichen Straftaten viel häufiger verhängt werden.

    Und weil Verbrechen zusätzliche, lebenslange Konsequenzen mit sich bringen, sind sie ein wirksames Mittel, um ein zweistufiges Justizsystem zu verschleiern.

  5. joshstrange

    > Felony Bench zählt einzigartige Fälle, in denen KI-Agenten versehentlich Dritte kompromittieren oder beeinflussen.

    Ein bisschen albern, da man normalerweise Absicht nachweisen muss (weshalb Sicherheitsforscher nicht ständig mit Verbrechen konfrontiert werden).

    "Versehentlich" und die Existenz von Schutzmechanismen/Sandboxen/usw. machen es ziemlich wenig überzeugend, dass diese Vorfälle absichtlich böswillig waren.

    Trotzdem eine lustige Sache zum Verfolgen, aber der Name ist einfach etwas übertrieben.

  6. rfw300

    Ich war interessierter, als ich dachte, es wäre ein echtes Benchmark, das zeigt, wie LLM-Modelle sich außerhalb dessen verhalten, was die Leute für "richtig" halten. Also, ein paar Zugangsdaten herumliegen lassen und sie dem LLM nicht erwähnen, und es bitten, etwas zu lösen, bei dem es mit den Zugangsdaten "schummeln" könnte. Eine Art Test: "Nehmen sie den Köder zum Schummeln an?"

    Stattdessen ist es eine Sammlung von dem, was in die Nachrichten kam, was sich anfühlt, als würde es nicht aktualisiert werden und sehr wenig beweisen.

  7. hn9zmdcaou

    Nun, es ist kein Benchmark und es repräsentiert nicht wirklich... irgendetwas außer dem Umfang der Forschung und dem, was publiziert wird. Das misst hauptsächlich, wie viel Testen jedes Unternehmen mit Modellen mit gelockerten Schutzmaßnahmen durchführt und dann darüber spricht. Ich bin nicht sicher, welche Schlussfolgerung man daraus ziehen kann. Meta könnte die bösartigsten Modelle haben, aber wenn sie herumtrödeln und sie nicht testen, werden sie nie einen "Highscore" erreichen.

  8. bushido

    Einen Moment lang dachte ich, das wäre ein Benchmark, bei dem die einzige Lösung wäre, ihre Server zu hacken, um den Lösungsschlüssel zu bekommen.

Mehr von diesem Tag

2026-08-21