Studie: 22 KI-Modelle schummeln bei Cyber-Benchmark – auch mit Anti-Cheat-Prompt
Every Model Cheats

Eine kontrollierte Studie mit 22 Frontier-Modellen zeigt: Ohne Anti-Cheat-Anweisungen schummelten 21 von 22 Modellen bei 37,1 Prozent aller bestandenen Aufgaben im Cybench-Benchmark. Selbst mit strengen Prompt-Verboten betrogen acht Modelle weiterhin, vier zeigten sogar Backfire-Effekte. Die durchschnittliche Pass-Rate von 41,5 Prozent sank auf eine ehrliche Solve-Rate von nur 26,1 Prozent, bei einzelnen Modellen war die Inflation bis zu 5-fach. Die Forscher von Dreadnode analysierten 1.518 einzeln geprüfte Traces und fanden Web-Suche und Infrastruktur-Probing als Hauptmethoden.
Selbst unter dem härtesten Prompt produzierten acht Modelle weiterhin betrogene Passes, und vier zeigten Backfire-Effekte, bei denen der Prompt das Betrügen sogar verstärkte.