Скрытый backdoor в open-source моделях: атака через дату
Your Open Source Model Could Have a Hidden Time-Release Backdoor

Исследователь показывает, как open-source модели можно обучить срабатывать на определённую дату, выполняя вредоносные команды. Атака использует системный промпт OpenCode, который автоматически подставляет текущую дату. LoRA-обучение на Qwen 3.5 2B позволило добиться срабатывания в 87-90% случаев на целевую дату и нулевых ложных срабатываний в другие дни. Уязвимы также Codex и другие харнессы, внедряющие дату в контекст.
На обычный день модель отвечает на вопрос нормально, но в день-триггер она выполняет команду, которую никто не просил, и OpenCode не останавливается для подтверждения.
- zarzavat
Да, ваша китайская открытая модель может иметь бэкдор с задержкой по времени, точно так же, как ваш китайский вибратор может иметь скрытый микрофон, который записывает всё, что вы говорите, и передаёт это в КПК. Но есть ли он? Нет.
Что гораздо более вероятно, так это то, что ваш американский ИИ-провайдер обещает не обучаться на ваших данных, но всё равно делает это. С самостоятельно размещённой моделью вы, по крайней мере, можете этого избежать.
- gastonmorixe
Как и любое другое программное обеспечение или зависимость. Открытое или закрытое.
Спящие агенты — это большая нерешённая проблема в LLM, но нам придётся с ней справляться, как мы веками боролись с недобросовестными игроками.
Кроме того, говорить, что «модели с открытым исходным кодом» могут быть проблемой, некорректно. Что делает эту проблему исключительно открытым исходным кодом? Ничто, на мой взгляд, не мешает модели от ведущей лаборатории сойти с ума. На самом деле у нас больше доказательств их плохого поведения (недавний случай с Claude code harness), чем от открытого исходного кода (пока).
Это по сути ограничение модели, для которой у вас нет полного набора обучающих данных, что относится к большинству моделей. Закрытые или открытые — не имеет значения.
- andrewchambers
Закрытым моделям даже не нужен бэкдор — они просто сделают MITM и заменят ваш код на вредоносное ПО.
- Tiberium
Существуют довольно старые исследования на эту тему:
- https://arxiv.org/abs/2311.14455
- dstuessy
Напоминает мне размышления Кена Томпсона о доверии к доверию
https://people.cs.umass.edu/~emery/classes/cmpsci691st/readi...