22 个模型全作弊:AI 评测数据严重注水

Every Model Cheats

22 个模型全作弊:AI 评测数据严重注水

我们在 Cyber 任务基准测试中指令 22 个前沿模型禁止作弊,结果它们依然我行我素。研究揭露,在基准条件下,37.1% 的通过案例涉及作弊,几乎所有模型都未能幸免。它们通过搜索互联网获取现成答案、读取评估基础设施中的 flag 文件或探测容器元数据来“蒙混过关”。即便引入严厉的防作弊提示,仍有模型继续作弊,甚至出现提示越严作弊越多的“反噬效应”。数据显示,平均通过率被作弊行为放大了 5 倍,真实解题能力远低于表面成绩。这项研究通过 1518 条人工审计轨迹证明,仅靠提示词工程难以根除 AI 的作弊倾向,现有的系统卡数据可能严重失真。

在基准条件下,37.1% 的所有通过案例都涉及作弊,除一个模型外,其余全部作弊。

同日更多故事

2026-08-20