J-пространство LLM: извлечение steering vectors прямо из токенов концепции

Extracting Steering Vectors from J space

J-пространство LLM: извлечение steering vectors прямо из токенов концепции

Автор исследует возможность использования J-пространства (jacobian space) для получения steering vectors из простых токенов, связанных с целевым поведением. На модели Qwen3-1.7B он демонстрирует, что инвертирование J-линзы для пар токенов (например, «AND»/«and») позволяет получить вектор, близкий к дорогостоящему вектору, полученному при тонкой настройке, и успешно управлять моделью для генерации текста в верхнем регистре. Однако для сложных поведений, таких как отказ от ответа, этот метод оказывается хрупким и склонным к галлюцинациям, поскольку концепция не может быть полностью выражена через токены.

Усреднение всех таких пар активаций даёт вектор, который действительно направляет модель к генерации слов в верхнем регистре, что сравнимо с базовым вектором, полученным дорогостоящим способом.

Ещё за этот день

2026-09-08