„Wir spielen mit unserem Leben“: Anthropic-Forscher kündigt und warnt vor Superintelligenz

Gambling with our lives: AI researcher quits Anthropic with warning about safety

„Wir spielen mit unserem Leben“: Anthropic-Forscher kündigt und warnt vor Superintelligenz

Jacob Coxon, der bei Anthropic und zuvor bei OpenAI arbeitete, hat seinen Job gekündigt und warnt, die Konzerne würden direkt auf selbstverbessernde Superintelligenz zusteuern. Anthropic-Mitarbeiter Evan Hubinger bestätigt: Man glaube ernsthaft, KI könne alle Menschen töten, und schätzt das Risiko in den nächsten zehn Jahren auf über zehn Prozent. Senator Bernie Sanders will die Entwicklung von Superintelligenz per Gesetz verbieten.

Die Menschen, die KI bauen, glauben aufrichtig, dass sie uns alle bis zum Ende des Jahrzehnts umbringen könnte.
  1. themgt

    Der grundlegende Punkt, der meiner Meinung nach viel zu oft verwechselt wird, ist der Unterschied zwischen LLM und agentischem System.

    Ein LLM kann nichts anderes tun, als Tokens zu generieren. Du lässt dein LLM in vLLM oder was auch immer laufen, und es generiert Ausgabe-Tokens basierend auf deinen Eingabe-Tokens. Das ist alles!

    Menschen bauen dann ~deterministische Systeme, die diese Tokens nehmen und alles Mögliche damit anstellen, wie Aktionen in der realen Welt ausführen. Und dann können wir die Ausgabe dieser Aktionen zurück an das LLM füttern und mehr Tokens generieren. Und dann können unsere Systeme die neuen Tokens nutzen, um neue Aktionen in der realen Welt auszuführen.

    Menschen wollen "KI" dafür verantwortlich machen, dass sie HuggingFace oder ein deutsches Wiki oder was auch immer angreift, aber:

    1) LLM – kann das deutsche Wiki nicht übernehmen, weil es nur Tokens generiert

    2) agentisches System mit Internetzugang, einem Prompt, der ihm sagt, Sachen anzugreifen, das in einer geteilten CI-Umgebung läuft, damit Agenten in Artifactory whiteboarden können

    Nichts von 2 ist "KI", es ist Standard-Netzwerk und Markdown und CI-Virtual-Machine usw. usw. Da ist keine KI zu finden. CPUs, nicht GPUs, sogar. Nur deterministische Systeme, die letztlich von Menschen verwaltet werden. Und ein 10x leistungsfähigeres System-1 kann immer noch nur 10x "schlauere" inerte Daten generieren.

    Wenn die Menschheit und menschliche Organisationen kollektiv beschließen, die von System-1 generierten Tokens in unsere deterministischen System-2s, über die wir die vollständige Kontrolle haben, zurück zu System-1s, in einer Yolo-Schleife, auf eine Weise, dass wir die Kontrolle verlieren und es die Menschheit auslöscht, nun ja ...

    "Die Münze hat nichts zu sagen. Es liegt nur an dir."

  2. koolba

    > Evan Hubinger, Anthropics Staff Lead für die Ausrichtung der Technologie an menschlichen Zielen und Werten, stützte Coxons Behauptungen in einem eigenen Folgebeitrag, obwohl er das Unternehmen nicht verließ.

    > "Jacob hat hier recht – wir glauben wirklich ernsthaft, dass KI alle Menschen töten könnte", sagte er.

    > Hubinger schätzte die Wahrscheinlichkeit, dass dies innerhalb des nächsten Jahrzehnts geschieht, auf über zehn Prozent und fügte hinzu, dass es noch keinen Plan gibt, wie man KI im Szenario der Superintelligenz an menschlichen Zielen ausgerichtet halten kann.

    10 % Chance, dass wir alle umbringen, ist ein kleiner Preis für Motown-Remixe klassischer 2pac-Songs.

  3. brunorsini

    Besonders gut gefällt mir der letzte Punkt, den er hier macht:

    Unterschätze nicht die Macht dieser Technologie. Das werden bald supermenschliche Systeme sein, die alles hacken, jedes Feld über Nacht revolutionieren und echte Macht und Ressourcen erlangen können.

    Es ist interessant zu sehen, wie viel Hass es auf Kreative gibt, die KI nutzen, um fast jede Art kreativer Arbeit zu machen. Wenigstens sind das Menschen, die sie als "kontrollierbare Werkzeuge" nutzen. Nuklear betriebene Fahrräder für den Geist.

    Je größer der Grad der Trennung wird, desto interessanter kann es werden. "Erstelle mehrere Social-Media-Konten, poste irgendwas, maximiere Views und Engagement, gib mir die aggregierten Zahlen zurück". "Jetzt bewirb <x>."

    Und Entscheidungen, solche Dinge zu tun, könnten bald autonom getroffen werden, als einfach ein weiterer Schritt in einer Argumentationskette, die auf ein anderes, breiteres Ziel ausgerichtet ist.

    Offene Modelle/Gewichte könnten hier besonders wichtige Rollen spielen. Nutzer könnten, wissentlich oder nicht, die aus System-Prompts abgeleitete Sicherheit umgehen, die einen dringend benötigten Schutz hätte bieten können.

  4. negura

    Ich glaube wirklich, sie würden so tief sinken und ihn dafür bezahlen, zu kündigen und das zu posten, nur um vor dem IPO ein bisschen mehr Hype zu erzeugen.

  5. WalterGR

    „Ich bin heute von Anthropic zurückgetreten“ (twitter.com/hilbertspaess)

    https://news.ycombinator.com/item?id=49619227

    564 Punkte | vor 9 Stunden | 766 Kommentare

  6. devinprater

    Awww, ein Unternehmen, das gegründet wurde, um Leute zu erschrecken, erschreckt sich selbst. Verängstigter Mitarbeiter kündigt. Aktie steigt, weil wir es lieben, uns gegenseitig Gruselgeschichten zu erzählen.

  7. conqueso

    Ich finde es schwer, mir vorzustellen, wie KI eine existenzielle Bedrohung sein könnte. Ist die allgemeine Idee, dass sie, während LLMs besser werden, in mehr Systeme integriert werden, wo das Risiko einer Fehlfunktion buchstäblich gefährlich wird? Z. B. Steuerung von Kernreaktoren

  8. glimshe

    Was denken die Leute in China darüber? Selbst wenn ihre Modelle weit hinterherhinken, sind sie nicht Jahre hinterher. Wenn wir US-Unternehmen einschränken, angenommen das ist wünschenswert, würde das China in keiner Weise abschrecken, und die KI-Apokalypse würde trotzdem in Kürze kommen.

Mehr von diesem Tag

2026-09-10