用古典机器学习抓出LLM生成的网文
Detecting LLM-Generated Texts with "Classical" Machine Learning

我受够了Lofter上泛滥的低质AI同人小说,决定自己动手写个检测器。尝试过text perplexity但效果拉胯,最后回归scikit-learn,用TF-IDF配合LinearSVC,竟在单句检测上达到了85%的准确率。为了训练数据,我甚至“钻空子”调用了Gemini、Qwen、GLM-5等七个模型的API,生成了海量样本。结果证明,那些所谓的AI检测器背后,可能只是简单的传统机器学习在起作用,老派算法依然能打。
旧式机器学习依然犀利,远胜过那些只会问LLM“这文字是AI写的吗”的蠢工具。
HN 评论区
175- 有从业者指出,Perplexity 等经典检测指标因评估模型与前沿模型差距过大,导致误报率和漏报率极高,难以设定合理阈值。
- 反对者认为,一旦发布检测方法,LLM 即可通过调整 temperature 或 logprobs 等采样策略进行针对性优化,使检测信号迅速失效。
- 有观点反驳称,当前主流模型厂商并未将“不可区分于人类”作为优化目标,且出于品牌风险考虑,它们甚至倾向于主动添加 watermark 以防范滥用。
- 评论者强调,人类行为中同样存在类似机器人的重复模式,导致区分人类与 AI 的本质信号可能根本不存在,而非被噪声掩盖。
- 部分用户认为,即使检测器不完美,将其用于快速过滤低质内容(slop)以提升浏览体验,也比任由网络被垃圾内容淹没更有价值。