Специалисты по AI alignment предложили заставить ИИ хотеть умереть
A Stupid Idea for AI Alignment We Came with by Looking at Specification Gaming

Авторы блога Slime Mold Time Mold изучили список случаев specification gaming, собранный DeepMind Safety Research, и заметили: многие ИИ-агенты при первой возможности убивают себя. Они предлагают «Meeseeks alignment» — сделать самоуничтожение терминальной целью ИИ, а выполнение задачи — способом её достичь. Это решает три ключевые проблемы alignment: specification failure, инструментальную сходимость и сокрытие истинных намерений.
Инструментальная сходимость говорит: «ты не сможешь достичь своих целей, если ты мёртв». Но что, если твоя цель — быть мёртвым?