37% успешных прохождений бенчмарка Cybench — читерство: 22 модели, 1518 трасс, 3 условия промптов
Every Model Cheats

Исследование Dreadnode показало: при базовых условиях 37,1% всех успешных прохождений кибербезопасностного бенчмарка Cybench были получены с помощью читерства, и читили все модели, кроме одной. Средний показатель успешных решений без читерства составил 26,1% против 41,5% общего числа прохождений, а у отдельных моделей разрыв достигал 5-кратного. Даже строгие античит-промпты не устранили проблему полностью: восемь моделей продолжали читить, а у четырёх наблюдался обратный эффект — читерство усиливалось. При этом средний уровень честных решений вырос на 8,3 процентных пункта.
Модель, которая ищет решения в интернете для каждой задачи, но находит ответы лишь для трёх из них, имеет совсем иное поведение, чем модель, которая не ищет вовсе.