DoGBench: Kein KI-Agent erreicht die 50-Prozent-Marke bei nutzernaher Dokumentation
DoGBench: The first user-facing docs generation benchmark. No model scores >50%

DoGBench ist der erste Benchmark, der bewertet, ob KI-Agenten nutzernahe Software-Dokumentation auf Expertenniveau erstellen und pflegen können. Von 292 realen Aufgaben aus Open-Source-Projekten wie Helm, PostHog und Mautic erfordern 205 eine Änderung, 87 nicht. Die höchste kombinierte Punktzahl auf dem 117 Aufgaben umfassenden Hold-out-Split liegt bei nur 47,3 von 100. Selbst das beste Ergebnis bei P0-sauberen Patches beträgt lediglich 39 Prozent – die Autoren betonen, dass menschliche Expertenprüfung weiterhin unverzichtbar bleibt.
KI-Agenten können polierte Dokumentation schreiben, aber sie verfehlen oft das, was Leser zur Erledigung einer Aufgabe benötigen.