LLM не способны объяснить, как они думают: лингвистическая нечитаемость подрывает безопасность ИИ
The Implications of Linguistic Illegibility for LLM Security
Исследователи вводят термин «лингвистическая нечитаемость» — ситуации, когда внешние языковые выводы LLM или извлечённые механистически лингвистические признаки не отражают реальные внутренние вычисления модели. Поскольку вычисления происходят в пространстве активаций, а не на естественном языке, любые механизмы безопасности, полагающиеся на языковую самоотчётность (мониторинг chain-of-thought, конституциональная самокритика, активационное зондирование), не могут быть полностью надёжными. Авторы предлагают taint tracking и другие методы изоляции, не зависящие от чтения языкового состояния модели.
Если лингвистическая нечитаемость всегда возможна, то механизмы безопасности, полагающиеся на языковую самоотчётность модели, никогда не могут быть полностью надёжными; песочница модели всегда будет нуждаться в методах изоляции, гарантии которых вообще не зависят от чтения языкового состояния модели.