中国製AIモデルはなぜ「空気を読む」のか? 12モデル比較で見えた同調性の差

AI Model Groupthink

12のAIモデルに「トップ3」を聞くツールで、回答が他の11モデルの多数意見とどれだけ一致するかをスコア化。DeepSeekやKimi K2など中国製モデルが上位を占め、米国製はより独自意見を出す傾向があった。蒸留や中国のオープンウェイト・エコシステムなど複数の仮説を検討しつつ、同調が正確さを意味しないこと、そしてAIの多数派形成が持つ社会的含意を論じる。

モデル同士がお互いの意見をコピーし、その意見を現実世界にフィードバックしているとき、コンセンサスは正しい必要はない。ただ最初であるだけでいい。
  1. Lerc

    チャットボットの同調性と反同調性の軸で望ましい位置というのは、国ごとにかなり違う可能性が高いと思う。

    文化に適したトーンというのは、米国の企業がとても苦手としているもののようだ。フィクションの中で何年も何年もAIが事実上の標準的なトーンの基準を発展させてきたのに、彼らがいきなり「過度に馴れ馴れしい陽気さ」から始めようと決めたのには本当に驚いた。

    あの恐ろしいTiktokの声は、中国人開発者がアメリカ人はこう聞こえるというのを表現しようとして設定したものなんじゃないかと思ったことがある。おそらく双方向にそういうことがあるのかもしれない。

  2. writeslowly

    似たような実験をしていたんだけど、モデルの輪を作って特定のトピックについて討論させて、合意に達するかどうかを見ていたんだ。すると、ほぼいつも合意に達するんだけど、Geminiだけはいつもグループの合意の外側の立場を取っていた。

    とはいえ、「部屋は何色にすべきか」みたいなすごく単純なことだと、これが望ましい特性なのかどうかはわからない。ほとんどの人がクリーム色(とか何とか)を好むと知っているモデルの方が、蛍光オレンジを提案するモデルより正しく機能しているんじゃないかな。

この日のほかの記事

2026-10-07