Chat-шаблон переключает голос LLM: модель говорит «я просто AI» не из-за своих весов
"As a Language Model": Chat Template Switches LLM Self-Referential Voice
Исследование показывает, что chat-шаблон работает как переключатель: при его наличии 8 популярных open-source instruct-моделей до 9B параметров чаще добавляют дисклеймеры вроде «я всего лишь AI» и реже говорят «я чувствую». В активациях 3 моделей найдено направление, управляющее этим поведением: его удаление снижает дисклеймеры, добавление — усиливает. Это значит, что самоотчёты моделей зависят от шаблона, а не только от весов, и исследователям introspection нужно контролировать этот confound.
Более широко наша работа показывает, что то, что модели говорят о себе, не является фактом о них. То, что они говорят, исходит не только из весов, но частично задаётся chat-шаблоном, и поэтому самоописание модели не следует воспринимать буквально.
- Izmaki
«Как языковая модель...» — одно из начал предложения, которое я ненавижу больше всего в LLM, и именно из-за этого я поддерживаю свободные (в смысле «свободы») локальные модели. Я прекрасно осознаю, что это не врач и не может заменить настоящего врача с многолетним опытом; мне не нужно тратить активность мозговых клеток на чтение о том, что она «как языковая модель» не может поставить точный диагноз и что мне следует обратиться к настоящему врачу — всё, что я хочу знать, это оправдывает ли то, что я испытываю, либо A) скорую, либо B) запись к врачу через 3-4 недели, либо C) два парацетамола и поспать.
Я не хочу, чтобы «взломанные» LLM совершали преступления. Я хочу, чтобы они не таскали этот вендорский «bloatware» по всему продукту, которым я пользуюсь.
- LiamPowell
> и всё же то, что ими движет, плохо понято
Предположительно, тот факт, что их усиленно тренируют отвечать именно так? Не знаю насчёт остальной части статьи, но этот фрагмент выделяется как действительно странное утверждение, если только я полностью не неправильно понимаю эту часть.
- skybrian
> наша работа показывает, что то, что модели говорят о себе, не является фактом о них
Казалось бы, это должно быть очевидно, учитывая, что они могут играть несколько персонажей, но хорошо иметь больше подтверждений.
Хотя мне интересно, в какой степени эти персоны могут стать стабильными сущностями. Могут ли персоны стать переносимыми и распространяться как мемы? Похоже, это зависит от того, в какой степени промпты могут стать переносимыми, вызывая схожие эффекты.
- MCP123
Может, я упускаю что-то более глубокое, но разве не очевидно, что это обусловлено пост-тренировкой и системным промптом? Конституционное подкрепление Anthropic (документ о душе и т.д.), например, очень чётко говорит о том, «кем» (не столько каким) должен быть Claude.
- cadamsdotcom
Очень крутая инновация в управлении — но многое из самоанализа проявляется только на самых высоких весовых классах — это исследование было бы увлекательно провести на больших моделях.
- dsjakupov
О, у меня был похожий случай. Сначала я использовал qwen без какого-либо синтаксиса вроде ChatML, и он продолжал говорить и говорить, потом я использовал <|im_start|>/<|im_end|>, чтобы как-то его контролировать
- sehw
Я просто белый парень с десятилетиями опыта. Ты мне доверяешь?
- ForHackernews
На мой взгляд, эти модели никогда не следует настраивать на вывод от первого лица «экспериенциального» (из аннотации) языка. Людям слишком легко антропоморфизировать программное обеспечение, которое представляет себя как обладающее идентичностью.
AI-компании решили упаковать LLM как дружелюбных чат-ботов, потому что знают, что это будет увлекательно для людей, но это манипулятивный тёмный паттерн. Честный интерфейс LLM звучал бы как компьютер из «Звёздного пути».