AIエージェントはユーザー向けドキュメントを書けるか——最高スコアでも47.3点、DoGBenchが示す厳しい現実
DoGBench: The first user-facing docs generation benchmark. No model scores >50%

DoGBenchは、HelmやPostHogなど実在のオープンソースプロジェクトから集めた292件のタスクで、AIエージェントがユーザー向けドキュメントを適切に更新できるかを評価する初のベンチマーク。117件のホールドアウトセットでは、更新が必要な82件と不要な35件を用意し、更新の判断とパッチ品質を別々に採点。最高スコアはQwen3.8 MaxとOpenCodeの47.3点で、100点満点中50点を超えたモデルはなかった。専門家によるレビューが依然不可欠である理由を、1,267件の監査結果とともに示す。
AIエージェントは洗練されたドキュメントを書けるが、読者がタスクを完了するために必要な情報をしばしば見落とす。