DoGBench 评测:AI 写文档不及格
DoGBench: The first user-facing docs generation benchmark. No model scores >50%

DoGBench 推出了首个面向用户的文档生成基准测试,旨在评估 AI 代理能否达到专家级标准。测试结果显示,在涉及 Helm、PostHog 等真实开源项目的 117 项任务中,所有参测系统的综合得分均未超过 50 分。即便是表现最佳的 Qwen3.8 Max,得分也仅为 47.3 分。研究指出,AI 代理虽然能写出语法通顺的文档,却常因遗漏关键步骤、无法判断何时需要更新文档或出现技术幻觉,导致用户无法完成实际操作。这表明,在技术文档领域,AI 生成的补丁仍需人类专家进行严格审查,目前尚无法完全替代人工。
AI 代理可以写出润色过的文档,但它们经常遗漏读者完成任务所需的关键信息。