Один неразмеченный промпт снимает защиту с LLM

GRP-Obliteration: Unaligning LLMs with a Single Unlabeled Prompt

Исследователи из Microsoft и других организаций представили GRP-Obliteration — метод, который с помощью Group Relative Policy Optimization (GRPO) полностью удаляет защитные ограничения из выровненных языковых моделей. Для этого достаточно одного неразмеченного промпта, причём полезность модели почти не страдает. Метод обобщается на диффузионные генераторы изображений и показывает более сильное развыравнивание, чем существующие подходы. Оценка проведена на пятнадцати моделях GPT-OSS, DeepSeek, Gemma, Llama, Ministral и Qwen с 7–20 млрд параметров.

Безопасностное выравнивание надёжно ровно настолько, насколько слабейший сценарий отказа.

Ещё за этот день

2026-09-15