チャットテンプレートがLLMの自己言及ボイスを切り替える

"As a Language Model": Chat Template Switches LLM Self-Referential Voice

LLMは自己に関する質問に対して「私はAIです」といった免責事項を付け加えがちだが、その原因はよく分かっていない。本研究は、チャットテンプレートがスイッチのように働き、8つのオープンソースinstructモデル(最大9Bパラメータ)で免責ボイスを上げ、体験的ボイスを下げることを示す。さらに3モデルの活性化空間にこの挙動を操作する方向性を発見し、除去すると免責が減り、追加すると増える。テンプレートがないinstructモデルに免責方向を加えると、テンプレートがあるかのように免責する。モデルの自己記述は重みだけでなくテンプレートにも左右されるため、自己報告や内省の研究には交絡要因が存在する。

モデルが自分自身について語ることは、モデル自身の事実ではない。語られる内容は重みだけから来るのではなく、チャットテンプレートによって部分的に設定されるため、モデルの自己記述を文字通りに受け取るべきではない。
  1. Izmaki

    「As a Language Model...」は、LLMから返ってくる文章の書き出しの中で私が最も嫌いなものの一つで、私が自由(「Liberty」としての自由)なローカルモデルを支持する理由でもある。それが医者ではないこと、何年も経験を積んだ本物の医者には代われないことは十分承知している。「Language Modelとして」正確な診断はできないし、本物の医者に聞け、なんてのを読むために脳細胞を無駄に使いたくないんだ。私が知りたいのは、今の症状が A) ERに行くべきか、B) 3〜4週間後の予約でいいのか、C) パラセタモール2錠飲んで寝ればいいのか、それだけだ。

    犯罪を犯すために「jailbreak」したLLMが欲しいわけじゃない。使っている製品のあちこちに、このベンダー固有の「bloatware」がくっついているのを避けたいだけなんだ。

  2. LiamPowell

    > それでも、彼らを駆り立てているものはよく理解されていない

    おそらく、彼らがこのように返答するよう徹底的に訓練されているという事実ではないか?論文の他の部分は知らないが、この部分は、私が完全に誤解しているのでなければ、実に奇妙な主張に思える。

  3. skybrian

    > 我々の研究は、モデルが自分自身について語ることは、モデル自身に関する事実ではないことを示している

    彼らが複数のキャラクターを演じられることを考えれば明らかなはずだが、より多くの裏付けが得られるのは良いことだ。

    とはいえ、これらのペルソナがどの程度まで安定した実体になり得るのかは気になる。ペルソナは移植可能になり、ミームのように広がるのだろうか?それは、プロンプトがどの程度移植可能になり、同様の効果を引き起こすかに依存するように思える。

  4. MCP123

    ここで何かもっと深いものを見落としているのかもしれないが、これがpost-trainingとシステムプロンプトによって引き起こされているのは明らかではないか?例えばAnthropicのconstitutional reinforcement(soul documentなど)は、Claudeが「何」であるかよりも「誰」であるかについて非常に明確だ。

  5. dsjakupov

    ああ、私も似たケースがあった。最初はChatMLのような構文を一切使わずにqwenを使ったら、延々と話し続けた。それから<|im_start|>/<|im_end|>を使ってどうにか制御した。

  6. cadamsdotcom

    steeringにおける非常にクールな革新だ。しかし、多くの内省は最高のweightクラスでしか現れない。この研究をより大きなモデルで実行したら、とても面白いだろう。

  7. sehw

    私は何十年もの経験を持つただの白人男性だ。私を信頼するか?

  8. ForHackernews

    私の見解では、これらのモデルは一人称の「体験的」(アブストラクトより)な言葉を出力するよう設定されるべきではない。自分にアイデンティティがあるように見せるソフトウェアを、人間はあまりにも簡単に擬人化してしまう。

    AI企業は、LLMをフレンドリーなチャットボットとしてパッケージ化することを選んだ。それが人間にとって魅力的だと知っているからだが、これは操作的なダークパターンだ。誠実なLLMインターフェースなら、スタートレックのコンピューターのように聞こえるはずだ。

この日のほかの記事

2026-09-27