AIは実企業の非公開コードで通用するか——最高でも解決率38.8%

Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases

Specific Labsが公開したReal-SWEは、実際の企業からライセンスした非公開のプロダクションコードベースでフロンティアAIモデルを評価するベンチマーク。請求や税計算、顧客移行などビジネスに直結するタスクを、ネイティブのハーネスで実行する。最高スコアはFable 5.1の38.8%で、10タスク中6タスクの解決率は15%未満。失敗の主因は要件の見落としで、短時間のロールアウトでも71.4%が失敗した。

今日のモデルは企業固有のコーディングパターンの理解が弱く、要件を見落としたり、前提を検証しなかったりすることが頻繁にある。
  1. glub

    SolとAstraが「未検証の前提」メトリクスでリードしていて、Fableの方がそこでは優れているというのは意外だ。

    私はFableをメインモデルとして使い、Solをアドバイザーとして毎ターン監視させている。Fableは確認もせずに前提を振りかざすのが好きで、しかもそれが単純に間違っている。Solはいつも実際にそれを検証しに行って、Fableが前提を置いていると警告してくれる。

    このペアを逆にしてFableをアドバイザーにしてみたこともある。するとただ「いい感じだね」と言って座っているだけだった。

  2. springtimesun

    まさにこれを自分のコードベースで作ったよ。セットアップはそれほど複雑じゃない。git履歴を変更直前まで分割して、そのコミット時点でエージェントが必要とするものを全部サンドボックスに入れて、ボックスの外を探しに行かないようにルールを軽く修正する。あとは同じプロンプト(たいていは作業を始めたチケット)を与えて、承認されたPRと照らし合わせて採点する。

    一番時間がかかるのは事例を見つけることだ。実際の開発フローではチケット→PR→マージなんてほとんどなくて、もっとあちこちに飛び回る。だから、掲げている目標はワンショットから脱することでも、基本的にはそういう環境を整えざるを得ない。そうしないと他の特定の結果(例えばエージェントがxに気づいて止まり質問を投げた、とか)をテストすることになる。

    やるのは時間がかかるけど、本当におすすめだ。今では新しいオープンモデルをこのバッテリーに通して、数日で過去のものとどう並ぶか見られる(ローカルで動かすから遅いけど)。これで「xモデルはyが得意でzが苦手」という感覚が、雰囲気からよりマシなヒューリスティックに変わる(これらはまだtemp 1で動かしていて、結果についてはヒューリスティックで考えるのが正しいと思っている)。自分の実際のコードと問題空間に根ざしたものになる。

    テストからの結論:Railsやフロントエンドのコードベースでは、私が試すほとんどのモデルは有能で、人間がループに入っていればマージ可能なPRに到達するという目標を達成できる。Claudeほど良くはなく、サブスクで補助された料金を払っているのでClaudeが今も最初のパスを担当している。レビューとして重ねるのはとても価値がある […]

  3. prometheus1992

    つまり彼らは最終的に、それらの非公開コードベースをOAIやAnthropicなどと共有したということ?あと、約30%という数字は自分の経験と一致する。モデルに期待しすぎて自分がおかしくなったのかと思っていたけど、Astraを含めてまだひどい。今朝も、ある問題を修正中にとても些細なことをやらかして、それを見て驚いた。あと2つ目、最近のベンチマークはあまり意味がない。

  4. lmeyerov

    私の直感では、より優れた・より大きな「非公開」コードベースの多くは、少なくともclaude codeやcodexの観点では、この時点でもはや実際には非公開ではない。

    少し違う領域だけど、botsbench.comを運営して得た教訓の一つは、毎回モデル汚染を測定せよということだ。

  5. janaksunil

    janakです。Specific Labs(YC F25)の共同創業者で、Real-SWEの著者の一人です。

    質問があれば[email protected]までメールしてください。電話番号も喜んで送ります :)

  6. jstummbillig

    GPT-5.6 Solがそのリストで最下位なのを見た自分の反応が妥当なのか、それともほとんど感情的なものなのか見積もろうとしているけど、判断する方法がないと気づく。

  7. chandureddyvari

    それはあなたのスキルとツール(テスト実行と検証——エージェントブラウザ、機能/ユニットなど)にもよる。

    GPT 5.6 SolがKimiやGLM 5.3に遅れを取っているのは私には意外だ。

    私の意見ではFable 5.1 ~ Astra > GPT 5.6 Sol > Opus。

  8. matheusmoreira

    似たような方法論を使った。コードレビューが私が最もリクエストするアクションなので、ブラインドのコードレビュー結果を使って最先端のAIを比較した。

    それについて記事も投稿した:

    https://www.matheusmoreira.com/articles/code-reviewing-lone-...

    TFAと違って、lone lispのコードは公開されている。モデルが私のコードベースで訓練された可能性はあると思う。それでも、興味深い結果が出たと思う。

    これには何ヶ月も、そして大量のトークンがかかったので、新しいモデルが出るたびにこの研究を繰り返すつもりはない。ただ、これで今後の期待値はすべて固定された。私に関する限りOpenAIが勝っていて、彼らのサイバーセキュリティプログラムが唯一残った痛点だ。

この日のほかの記事

2026-09-12