DoGBench: ни один агент не набрал больше 50% за пользовательскую документацию
DoGBench: The first user-facing docs generation benchmark. No model scores >50%

DoGBench — первый бенчмарк для генерации пользовательской документации: 292 задачи из реальных open-source-проектов (Helm, PostHog, Mautic, Doc Detective), из них 205 требуют правок, 87 — их отсутствия. Лучший результат на 117 отложенных примерах — 47,3 из 100 у Qwen3.8 Max с OpenCode. Аудит 1267 патчей выявил 45,5% с пробелами в выполнении задачи и 36,6% с техническими неточностями. Даже самый высокий показатель P0-clean — 39,0%.
Среди семи дорожек «модель + harness», описанных в статье, наивысший совокупный балл на отложенной выборке из 117 заданий составил 47,3 из 100 — его достигла Qwen3.8 Max с OpenCode.