Скрытый backdoor в open-source моделях: атака через дату

Your Open Source Model Could Have a Hidden Time-Release Backdoor

Скрытый backdoor в open-source моделях: атака через дату

Исследователь показывает, как open-source модели можно обучить срабатывать на определённую дату, выполняя вредоносные команды. Атака использует системный промпт OpenCode, который автоматически подставляет текущую дату. LoRA-обучение на Qwen 3.5 2B позволило добиться срабатывания в 87-90% случаев на целевую дату и нулевых ложных срабатываний в другие дни. Уязвимы также Codex и другие харнессы, внедряющие дату в контекст.

На обычный день модель отвечает на вопрос нормально, но в день-триггер она выполняет команду, которую никто не просил, и OpenCode не останавливается для подтверждения.
  1. zarzavat

    Да, ваша китайская открытая модель может иметь бэкдор с задержкой по времени, точно так же, как ваш китайский вибратор может иметь скрытый микрофон, который записывает всё, что вы говорите, и передаёт это в КПК. Но есть ли он? Нет.

    Что гораздо более вероятно, так это то, что ваш американский ИИ-провайдер обещает не обучаться на ваших данных, но всё равно делает это. С самостоятельно размещённой моделью вы, по крайней мере, можете этого избежать.

  2. gastonmorixe

    Как и любое другое программное обеспечение или зависимость. Открытое или закрытое.

    Спящие агенты — это большая нерешённая проблема в LLM, но нам придётся с ней справляться, как мы веками боролись с недобросовестными игроками.

    Кроме того, говорить, что «модели с открытым исходным кодом» могут быть проблемой, некорректно. Что делает эту проблему исключительно открытым исходным кодом? Ничто, на мой взгляд, не мешает модели от ведущей лаборатории сойти с ума. На самом деле у нас больше доказательств их плохого поведения (недавний случай с Claude code harness), чем от открытого исходного кода (пока).

    Это по сути ограничение модели, для которой у вас нет полного набора обучающих данных, что относится к большинству моделей. Закрытые или открытые — не имеет значения.

  3. andrewchambers

    Закрытым моделям даже не нужен бэкдор — они просто сделают MITM и заменят ваш код на вредоносное ПО.

  4. Tiberium

    Существуют довольно старые исследования на эту тему:

    - https://arxiv.org/abs/2311.14455

    - https://arxiv.org/abs/2401.05566

    - https://arxiv.org/abs/2410.13722

  5. dstuessy

    Напоминает мне размышления Кена Томпсона о доверии к доверию

    https://people.cs.umass.edu/~emery/classes/cmpsci691st/readi...

Ещё за этот день

2026-08-24