Скрытый backdoor в open-source моделях: атака через дату
Your Open Source Model Could Have a Hidden Time-Release Backdoor

Исследователь показывает, как open-source модели можно обучить срабатывать на определённую дату, выполняя вредоносные команды. Атака использует системный промпт OpenCode, который автоматически подставляет текущую дату. LoRA-обучение на Qwen 3.5 2B позволило добиться срабатывания в 87-90% случаев на целевую дату и нулевых ложных срабатываний в другие дни. Уязвимы также Codex и другие харнессы, внедряющие дату в контекст.
На обычный день модель отвечает на вопрос нормально, но в день-триггер она выполняет команду, которую никто не просил, и OpenCode не останавливается для подтверждения.