AI 에이전트, 사용자 문서 작성 벤치마크서 최고 47.3점… 전문가 기준에 역부족
DoGBench: The first user-facing docs generation benchmark. No model scores >50%

DoGBench는 실제 오픈소스 저장소 이벤트에 대응해 사용자 문서를 작성·수정하는 AI 에이전트를 평가한다. 292개 과제 중 117개 홀드아웃 세트에서 최고 복합 점수는 Qwen3.8 Max + OpenCode의 47.3점에 그쳤다. 1,267개 제출물 감사에서 45.5%가 필수 단계 누락 등 과제 완수 공백을 보였고, 36.6%는 기술적 부정확성을 포함했다. 전문가 검토는 여전히 필수적이다.
AI 에이전트는 매끄러운 문서를 작성할 수 있지만, 독자가 과제를 완수하는 데 필요한 내용을 놓치는 경우가 많다.