超三成 ArXiv 新论文读起来像 AI 写的
Over 30% of new ArXiv submissions now read as AI-written

我们分析了12,750篇 ArXiv 论文,发现约三分之一的新提交内容读起来像是机器生成的。这项研究特别设置了 ChatGPT 出现前的2021至2022年作为对照组,将误报率严格控制在0.4%。结果显示,自 ChatGPT 问世后,AI 写作比例呈两波上升趋势,近期峰值接近39%。计算机科学领域受影响最深,达65%,而数学领域因文本结构特殊,检测值偏低。这并非简单的“AI 生成”指控,而是揭示了学术写作中重度 AI 辅助编辑的普遍现象。真正的挑战在于,我们如何区分人类智慧与机器润色,以及这种趋势对科研诚信的长远影响。
如果工具将40%的新论文标记为机器生成,却也将20%的 ChatGPT 出现前的论文标记为机器生成,那么真正的故事就是那20%无人提及的误报。
HN 评论区
171- pbui
我有点拿不准该怎么看……我上传了一篇 2011 年写的 PyHPC 研讨会论文,结果显示 27% 是机器生成的。
我还上传了 2012 年的博士论文,结果是 40% 机器生成,刚好低于 42% 的阈值。
我虽然不再发表论文了……但这是否意味着我写得像 LLM,还是说 LLM 是从我的文章里学来的?:p
更新:我又上传了一篇 2015 年写的 IEEE CLUSTERS 论文,结果竟然是 74% 机器生成 :|
- dopamine_daddy
我对 2021 年至 2026 年间的 12,750 篇 arXiv 论文全文进行了评分,以找出其中有多少被标记为机器生成,以及自 ChatGPT 发布以来这一比例增长了多少。我特意调整了检测器以避免误报。正因如此,ChatGPT 发布前的检测率约为 0.4%。
主要结果如下:2026 年 1 月,约 39% 的论文被标记为 AI 生成。在计算机科学领域,峰值甚至达到了 65%。数学领域几乎没怎么变动,仍维持在 0.7% 左右,不过那些证明密集的数学文本可能只是没被检测器正确识别。
所有这些都是检测器对统计信号的估算,并非证明任何特定作者使用了 AI。“机器生成”也可能意味着进行了大量的 AI 辅助编辑。
- ryandvm
当涉及企业在 LLM 的使用时,确实存在一些博弈论机制。开发人员正通过将 Claude Code 的“消防水龙”对准一切能用的地方,疯狂产出表面更优越的代码和文档。领导层鼓励这种做法,因为从他们的角度来看,这似乎没有任何 downside(弊端)。
很难说这些代码在结构上比以前更好还是更差,但它们确实数量庞大。就领导层而言,他们那些有缺陷的指标表明,数量才是唯一重要的事。我们要花上好几年才能弄清楚这是否是个好主意,以及是否值得为此付出认知退化的代价。
任何不整天使用 LLM 的人,产出量肯定无法与之相比。我无法想象科研界不会受到同样的因素影响,毕竟那里也是看谁能发表更多论文。
- pkage
像所有仅基于文本的 AI 检测方案一样,我对检测的准确性表示担忧。我对方法论持怀疑态度,特别是三个检测器分数的最终合并步骤——你怎么能确保这一步不会引入任何偏差?由于没有源代码,很难确切了解其工作原理或复现这项研究。
我也上传了自己(未发布)的 LLM 时代之前的研究文本样本,结果在 LLM 检测分数上似乎很高。在其他论文中,几乎每个句子都被标红为“偏向机器生成”,但这似乎并不影响分数?此外,尽管 LaTeX 格式理论上不应有影响,但相同文本带不带 LaTeX 格式,其得分却存在巨大差异。
从中得出的结论应该是:“检测生成文本非常困难,我们不应仅仅因为结果证实了假设就轻易接受。”
--
顺便一提,上面的这段文字也被评为高度机器生成,尽管我保证这是我亲手用人类的双手写的 :)。
- lingeringpine
我不是英语母语者,这对我来说并不意外。我认为我们写的大多数论文都会被 AI 检测器标记。
这并不是因为我们让 LLM 帮我们写一篇关于 X 的论文。而是因为我们不擅长用科学风格写作,而美国编辑却期望我们做到。有了 LLM,我们可以写出基础句子,告诉 LLM 我们的想法,它就能将其转化为优美的文字。
如果你自己写每一段,然后让 LLM 把该段落改得更具科学性,那这完全还是你的论文,但会被标记为 LLM 生成。如果你让 LLM 写论文,但你的英语足够好,你也能让它看起来像人类写的,尽管它其实不是。