TMLR主编实测:作者答不出自己论文
Asking Authors About Their Own Papers
作为TMLR的主编之一,我随机联系了10篇原本准备直接拒稿(desk rejection)的论文作者,邀请他们进行会议沟通。结果令人深思:在最终参与的7位作者中,有3人连自己论文的基本问题都答不上来,另外3人虽然能解释高层思路,但在技术细节上却支支吾吾。只有1位作者能回答所有问题,但我随后发现其论文存在重大错误。这次耗时20多小时的实验揭示了一个严峻现实:在AI生成内容泛滥的今天,许多作者无法为自己的论文负责。如果连作者都无法解释自己的研究,学术界的同行评审机制和贡献认定体系将面临巨大挑战。
如果作者无法解释论文的基本主张、方法或技术细节,这就是一个严重的问题。
HN 评论区
57- fn-mote
Medium 上针对这篇帖子的评论也很到位。用已接收的论文重复同样的实验是个很好的对照。用审稿人做类似的实验会很有趣,但也更招人烦,因为他们没拿钱。
我会把那些浪费审稿人好几个小时来证明自己不够格的作者列入私人黑名单(影子封禁)。不过,这种名单的存在本身就有问题。
我们这里用的那套系统能套用吗?已接收的作者可以“担保”那些“已死”的论文,以防它们被“自动处决”?
这套系统已经坏了,提供更多证据证明它坏了,对于修复它来说算不上什么进步。
- greenflag
这里的一个更大问题是,研究论文的价值很少在于它增加了的具体知识,而在于研究过程中为参与者(尤其是研究生)积累的集体知识和经验。AI 论文完全绕过了这一点。学术界对此也负有责任,因为它把论文当成了成功的硬通货。AI 生成的论文几乎是在整个系统层面 shortcut 学习。
- c7b
> 此外,我们小组一直在探索沿这些方向的方法,以使此类评估更具可扩展性
实际上,这听起来对同行评审来说是个挺有意思的想法,即在审稿人和作者之间加入面试环节。如果它能省去一轮反驳/回应,只要操作得当,甚至不需要大家多花太多时间。它会削弱的是双盲评审,但总得有所取舍,而且双盲评审本来也就在所剩无几了。
- WCSTombs
这是该期刊关于作者使用 LLM 的政策 [1]:
> LLM 可作为通用辅助工具使用。无论使用何种工具,作者对其列为(共同)作者的内容负全责。这包括但不限于由 LLM 生成的、可能被视为剽窃或学术不端(例如伪造事实)的内容。看似主要由 LLM 生成的低质量贡献(无论是投稿还是审稿)将受到严格审查,以寻找前述问题的证据,如学术不端。LLM 不具备作者资格。随着关于 LLM 在科学过程中使用的新信息出现,我们将定期修订此政策。
虽然它没有明确鼓励使用 LLM,但也已经站在门口了,在我看来,如此软弱的政策实际上正在加剧文章作者所抱怨的问题。依我之见,任何弱于“使用 LLM 生成提交的任何部分均不被允许,并被视为严重违反伦理”的政策都是疯狂的。人们常说这类政策无法执行,但这真的不是重点(至少一开始不是),因为还有像(颇具讽刺意味地)p-hacking 这样的事情,虽然很难检测,但依然被广泛视为不道德。我们还没有完全解决 p-hacking 问题,但至少大多数人都同意应该消除 p-hacking。
我很难不在此处读出言外之意。也许……
- mlmonkey
恕我直言(我不是论文作者,但在读研期间读了很多), genie 已经出瓶了。在我看来,唯一的出路是也用 LLM 来做审稿。基本上,用 LLM 过滤所有提交的论文,让它总结内容、找出最大弱点和主要优点等等,然后人类再用这些信息来审稿。基本上就是 LLM-as-a-reviewer。
我个人非常希望看到这样的会议:明确鼓励人们使用 LLM 来干活和写论文,同时也用 LLM 来审稿。