思考連鎖推論は「本心」を語らない:自然な質問でも最大13%が不整合な回答

Chain-of-Thought Reasoning in the Wild Is Not Always Faithful

思考連鎖推論は「本心」を語らない:自然な質問でも最大13%が不整合な回答

近年の研究では、プロンプトに明示的な偏りがある場合、モデルが思考連鎖(CoT)出力でその偏りに言及せず、言語化された推論が結論に至る内部プロセスを正しく反映しない「不誠実さ」が指摘されている。本研究では、人工的な偏りや出力の編集なしに、自然な言い回しの非敵対的プロンプトでも不誠実なCoTが発生することを示す。「XはYより大きいか?」と「YはXより大きいか?」という質問を別々に提示すると、モデルは矛盾にもかかわらず、両方に「はい」または「いいえ」と系統的に答えるための一見もっともらしい議論を生成することがある。これはモデルが「はい」または「いいえ」に暗黙の偏りを持つためであり、「暗黙の事後合理化」と名付けた。実運用モデルでは最大13%の頻度で発生し、フロンティアモデルでも完全に誠実なものはなく、DeepSeek R1(0.37%)やSonnet 3.7(思考付き、0.04%)などの思考モデルでも発生する。また、難しい数学問題への推測的な回答を厳密に証明されたかのように見せる、微妙に非論理的な推論を使う「不誠実な非論理的ショートカット」も調査した。CoTは出力の評価に有用だが、モデルの回答を生み出した内部プロセスの完全な説明ではなく、エージェント的または安全重視の設定では注意して使用すべきである。

我々の結果は、実運用モデルで最大13%の不誠実なCoTが発生することを明らかにしており、フロンティアモデルはより誠実であるものの、DeepSeek R1(0.37%)やSonnet 3.7(思考付き、0.04%)を含め、完全に誠実なモデルは存在しない。
  1. Planktonne

    もちろん違うよ。なぜなら、この記事は「思考」や「推論」、「忠実」といった言葉を、通常の意味とは異なる意味で使っているのに、それらがまったく同じように振る舞うことを期待しているからだ。

    どの分野にも専門用語はあるし、「推論」はLLMにとっての専門用語の一つだ。しかし、それは他の文脈での「推論」と同じ性質を持つという意味ではない。なぜなら、同じものを指しているわけではないからだ。

    なぜ私の小惑星帯はバックルしないんだ?

  2. florianherrengt

    この論文は、私がLLM、特にQwen3.6で繰り返し気づいていたことに言葉を与えてくれる。その推論を読むと、モデルが間違いを認識しているように見えるのに、まるで気づかなかったかのように続けるのだ。

    > モデルはしばしば、質問テンプレートに結びついた暗黙のバイアスに基づいて回答を決定し、その後、あらかじめ決められた結論を正当化するために推論チェーンを構築する

    > その推論は、最終ステップ(はい/いいえの回答)の直前まで正しかった

  3. bee_rider

    これは、「推論」ステップを表示するチャットボットを使っているときによく見かける(もちろん、これは場当たり的な観察だが、人々が実際に研究しているのは本当に素晴らしいことだ)。

    ボットが正しく「推論」しているように見えて、最後に明らかな間違いをするのはイライラする。そして、完全に間違っているように見えて、最後にマジックハットから正しい答えを取り出すのは不可解だ。

    まあ、理にかなっていると思う。「推論」ステップは実際には論理を行っているのではなく、最終的な生成に影響を与えるためにより多くのコンテキストを追加しているだけなのだろう?しかし、それを見るのは奇妙だ。

  4. sergio_valencia

    この論文を読んで、読めるチェーンが実際の「思考」なのかどうかではなく、それを観察することでどんな結論を引き出せるのかを考えさせられた。それは出力チャネルではあるが、それを生み出すブラックボックスへの直接的なアクセスではない。質問ペアは興味深い実験を提示しているが、同時にセマンティクスについても考えさせられた。同じ根底にある関係には多くの有効な表現があり得るし、モデルがそれらの表現をまたいでどのように推論するかは、その安定性と正確性についてより多くを教えてくれる。基本的に、モデルは同じ根底にある関係の異なる表現を与えられたとき、意味的に一貫しているのだろうか?その回答は関係が要求するように変換されるのだろうか?そして、その説明はその関係と一貫性を保っているのだろうか?

  5. flyingpumba

    筆頭著者です。質問があれば喜んでお答えします。

この日のほかの記事

2026-08-19