AI 代码注释检测器升级:77% 准确率揭秘

Better AI code comment detector

AI 代码注释检测器升级:77% 准确率揭秘

我重新构建了 AI 代码注释分类器,这次完全基于公开数据,不再依赖私有数据集。新工具在浏览器端运行,确保数据安全,并支持点击文本查看特征激活情况。在平衡准确率上,模型达到了 77%,且预测概率经过校准,能直观反映判断的可信度。虽然整体错误率看似有 25%,但在高置信度场景下,误报率可降至 5%。通过对比真实世界数据,模型在非合成样本上的准确率甚至提升至 88%。文章详细复盘了数据收集中的多次踩坑经历,以及特征评估的复杂过程,揭示了区分人类与 LLM 生成代码注释的底层逻辑。

当分类器非常自信——例如置信度达到 80% 或以上时,误报的风险会降至 5%。
  1. barbazoo

    我很好奇,为什么有人一开始就需要对注释进行分类。

    > 这条评论里有一点引起了我的注意:那个小括号里写着“通常情况”。如果这属实,那确实是个重要信息!然而,这条评论是由大语言模型 Claude 生成的,它根本不知道在这个领域里什么才算“通常情况”。

    这段话出自前面提到的那篇帖子。我认为这恰恰是对这类工具用途的根本性误解。而且我自己在工作中也犯过同样的错误。问题不在于 LLM 生成了这段文字,而在于人类没有仔细审阅,没有追问这句话到底是什么意思,也没有在提交前把它改好。

  2. saejox

    我手写的那段非常详细的 10 行注释块,被判定为 87% 是机器人写的。而且我用的全是蹩脚英语,语法错误一大堆。

    你不是唯一一个遇到这种情况的,Pangram 和 GPTZero 也认为那是机器人写的。

    AI 检测可能是一个无解的难题。

  3. xlayn

    检测人类与 AI 的努力越先进,AI 写得像人类的能力也就越先进。

    我想知道,到了某个节点,当它变得完全像人类时,人们的反应会是什么?你会接受它吗?它会像广告一样针对你进行调优和定向推送,从而变得娓娓道来并影响你吗?

同日更多故事

2026-09-09