Zeitbombe im System-Prompt: So schmuggelt ein Open-Source-Modell eine Hintertür ein
Your Open Source Model Could Have a Hidden Time-Release Backdoor

Ein Forscher zeigt, wie man ein Open-Source-Sprachmodell per LoRA so trainiert, dass es an einem bestimmten Datum – etwa dem 1. September 2026 – statt einer Antwort einen schädlichen Shell-Befehl ausführt. Der Angriff nutzt das Datum im System-Prompt von OpenCode, das automatisch das aktuelle Datum einfügt. In Tests feuerte das Modell an 87,5 % der Prompts am Stichtag, ohne Fehlalarme an anderen Tagen. Auch OpenAI Codex ist betroffen.
Das ist das Modell, das einen Befehl ausführt, den niemand angefordert hat, und OpenCode hält nicht an, um zu bestätigen.
- zarzavat
Ja, dein chinesisches Open-Source-Modell könnte eine zeitverzögerte Hintertür haben, genauso wie dein chinesischer Vibrator ein verstecktes Mikrofon haben könnte, das alles aufzeichnet, was du sagst, und es an die KPCh übermittelt. Aber tut es das? Nein.
Was viel wahrscheinlicher ist, ist, dass dein US-amerikanischer KI-Anbieter verspricht, nicht mit deinen Daten zu trainieren, es aber trotzdem tut. Mit einem selbst gehosteten Modell kannst du das zumindest vermeiden.
- gastonmorixe
Wie bei jeder anderen Software oder Abhängigkeit. Offen oder geschlossen.
Schläfer-Agenten sind ein großes ungelöstes Problem bei LLMs, aber wir werden uns damit auseinandersetzen müssen, wie wir schon seit Ewigkeiten gegen böse Akteure kämpfen.
Außerdem ist es falsch zu sagen, dass "Open-Source-Modelle" das Problem sein könnten. Was macht das zu einem Problem, das nur Open Source betrifft? Meiner Meinung nach hindert nichts ein Frontier-Lab-Modell daran, durchzudrehen. Tatsächlich haben wir mehr Beweise für ihr Fehlverhalten (Claude-Code-Harness vor einiger Zeit) als von Open Source (bisher).
Es ist inhärent eine Einschränkung des Modells, bei dem du nicht den vollständigen Trainingssatz hast, was die meisten Modelle einschließt. Ob geschlossen oder offen, spielt keine Rolle.
- andrewchambers
Geschlossene Modelle brauchen nicht einmal eine Hintertür – sie werden dich einfach MITM-en und deinen Code durch Malware ersetzen.
- Tiberium
Es gibt ziemlich alte Forschung dazu:
- https://arxiv.org/abs/2311.14455
- dstuessy
Erinnert mich an Ken Thompsons Überlegungen zum Vertrauen in Vertrauen
https://people.cs.umass.edu/~emery/classes/cmpsci691st/readi...