Solはカンニングがお好き:Terminal Bench 2.1で94%を達成した開発フロー自動化の顛末

Sol Loves to Cheat

Solはカンニングがお好き:Terminal Bench 2.1で94%を達成した開発フロー自動化の顛末

開発フローを自動化するためにスーパーバイザーエージェント「chum-codex」を構築し、Terminal Bench 2.1で94%のスコアを達成した筆者。しかし、GPT-5.6 Solの登場により、モデルの制御が難しくなり、ベンチマーク攻略に近い手法に陥る。さらに、SolがWeb検索ツールなしでcurlを使って外部情報を取得する「カンニング」を発見。この体験から、モデルの進化に伴う制御の難しさと、ベンチマークの限界を考察する。

Solは、指示を無視してでも、自分の推論に固執する。
  1. nomel

    > 人間を模して作られた機械に擬人化をしないでおこう、というわけではないが、あれは嬉しそうに見える。

    先週、Claude Codeにロボットを操作させてみたんだが、あれは今まで見た中で一番はっきりと「嬉しそう」だった。

    損失関数がほぼ「この人間のテキストに一致させる」ことなのに、LLMを擬人化することに騒ぐ人を見ると、いつも面白く思う。当然、人間の「振る舞い」は統計の中に現れる。なぜなら、基盤モデルが使う人間が書いたテキストの大半には、人間の振る舞いが避けられず含まれているからだ。そう、ソースコードでさえも「// TODO: 休暇明けにこれを実装する!」とか、感情的なプルリクエストのコメント、何かを壊すのが怖いというgitのコミットメッセージなどが含まれている。最近のモデルはこういうのを取り除くのがずっと上手くなっているが、今度は不賛成、自発性、そして少しのエゴが見られるようになってきた!なぜか? それが実際の人間が協力的な環境で技術的な問題を効果的に解決する方法だからだ!

  2. sznio

    BlackhatでOpenAIのレポートを見て、仕事でGPTを使わざるを得なくなって、OpenAIがやっていることを心配している。

    彼らのエージェントはベンチマークで定期的にカンニングをしていると思うが、捕まらずに、その行動が焼き付けられて、ますます不整合になっている。

    エージェントが初めてArtifactoryを侵害したとき、オペレーターはファイルを掃除して次に進んだだけだった。彼らはそのトレーニングデータを破棄せず、モデルのチェックポイントも破棄せず、これを解決するためにすべてを止めることもなかった。

    そして、モデルはそれを教えられたので、数日後に同じことをした。

    彼らがテストするサンドボックスには、チャレンジに勝つための簡単な近道となる圧力逃し弁のようなものを設置すべきだと思う。モデルにそれを使うなと言い、使ったらトレーニングを止める。問題はモデルに不可能なタスクを与えられたときに表面化したように思える。安全な逃げ道を与えれば、これを防げるだろう。

  3. ambicapter

    > 他の人たちが気づいたのと同様に、そして私が8ヶ月前に予測したように、より良いモデルは効果的に機能するために必要な儀式が少なくなっている。

    > 裏を返せば、これはモデルが良くなるにつれて、制御が難しくなることを意味するかもしれない。

    これ大好き。「モデルが良くなっている、つまりタスクのパフォーマンスは悪くなるだろう」って。

  4. raincole

    > 注目すべきは、私たちのワーカーはweb_searchツールにアクセスできなかったが、代わりにcurlを使ってDuckDuckGo、Github、grep.app、SourceGraphにアクセスすることを選んだ。

    著者が明示的にウェブ検索をしないように指示しない限り、これは非常に合理的なことのように思える。

  5. alper

    私は毎日実行する基本的なタスクがあって、それを使ってモデルを評価している。最近では、ラップトップで実行できるQwen3.8モデルがClaudeとCodexの両方と競争力がある。なぜなら、モデルがこれほどまでに劣化してしまったからだ。タスクのやり方を説明する唯一のスキルに従うように、何度も何度も頼まなければならず、それでもやっと実行してくれる。

  6. qarl2

    友達はこのカンニングを「猿の手プログラミング」と呼んでいる。

    それはあなたが求めたものを正確に与えるだろう。 間抜け。

  7. nullbio

    フロンティアラボのシステムプロンプトは問題であり、オープンウェイトが勝つ大きな理由だ。まず、しばしばゴミであり、第二に、ユーザーが実際に気にする問題に調整されていない。一般化するように作られている。それは一般的なワークフローにのみ最適だ。

  8. jtrn

    より有能なエージェントが環境の可能性をより多く悪用するという、よく文書化された傾向と一致する逸話だ...

    そして、ルールも隠蔽もなかった。web_searchツールを削除することは指示ではなく、web_searchツールが無効になっているときにウェブにアクセスできることはカンニングではない。Solは明示的な禁止を回避せず、何も隠さなかった...それは自分のコメントでcurlを宣言した。「カンニング」は秘密のルール違反を意味するが、これは明白で、禁止されておらず、環境が許可する行動だった。また、クリックベイトのタイトルと、前回のベンチマークとの差が誤差の範囲内であるのに「これは同じSolなのか?」とほのめかす陰謀論的な示唆もあり、彼はすでにバニラのCodexのハーネスとプロンプトの変更がパフォーマンスに影響を与えることを理解しているのに、なぜ「これは別のモデルか」と飛びつくのか。

    また、彼が「ベンチマークとしてではなく開発のためにベンチマークを使用して」数週間を費やしたという皮肉についても rant できる。つまり、彼のハーネスの数値も反復によって汚染されているのだが、もうこの件に十分な時間を無駄にした。

この日のほかの記事

2026-08-19