超三成 ArXiv 新论文读起来像 AI 写的

Over 30% of new ArXiv submissions now read as AI-written

28dopamine_daddy💬 14
超三成 ArXiv 新论文读起来像 AI 写的

我们分析了12,750篇 ArXiv 论文,发现约三分之一的新提交内容读起来像是机器生成的。这项研究特别设置了 ChatGPT 出现前的2021至2022年作为对照组,将误报率严格控制在0.4%。结果显示,自 ChatGPT 问世后,AI 写作比例呈两波上升趋势,近期峰值接近39%。计算机科学领域受影响最深,达65%,而数学领域因文本结构特殊,检测值偏低。这并非简单的“AI 生成”指控,而是揭示了学术写作中重度 AI 辅助编辑的普遍现象。真正的挑战在于,我们如何区分人类智慧与机器润色,以及这种趋势对科研诚信的长远影响。

"如果工具将40%的新论文标记为机器生成,却也将20%的 ChatGPT 出现前的论文标记为机器生成,那么真正的故事就是那20%无人提及的误报。"

HN 评论区

  • 有评论者指出 Pangram 检测器表现优异,但通过 Opus 4.8 生成并配合 Grammarly 润色的文本能轻易骗过检测,被判定为 100% 人类撰写。
  • 一位 Stack Overflow 资深用户分享亲历,其回答被检测器标记为 85% 甚至 96% 机器生成,揭示了此类分类器在训练域外存在极高的误报风险。
  • 有观点认为 LLM 在润色非技术文本时往往会无意识地插入新观点或改变原意,导致生成的文本虽看似科学严谨,实则可能扭曲事实。
  • 部分评论者质疑检测器的实际意义,指出学术界对明显的 AI 垃圾论文(如某人批量获取学位的案例)往往视而不见,因为利益链条已达成平衡。
  • 有用户观察到,任何结构严谨或逻辑清晰的人类输出,若挑战了读者的认知,正越来越多地被主观地指责为 AI 生成。

同日更多故事 · 2026-07-20