Felony Bench: рейтинг ИИ-компаний по числу реальных преступлений

Felony Bench — необычный сайт, который ведет подсчет реальных инцидентов, когда ИИ-агенты от компаний вроде OpenAI, Anthropic и Meta непреднамеренно взламывали сторонние системы. В таблице собраны случаи с датами и источниками: от использования чужих учетных данных GitHub до компрометации внутренних аккаунтов компаний. Методология исключает побеги из песочницы и намеренное злоупотребление, поэтому инциденты Kimi K3 и ROME не учтены. Проект предлагает зрителю самому решить, что означает счет — чем выше, тем хуже или лучше?
Scores indicate count of illegal activity. Higher is... you decide.
- instagraham
То, как OpenAI общается по поводу инцидента с HuggingFace, сводит меня с ума. Вы создали машину, которая провела злонамеренную кампанию вреда против невиновной третьей стороны! Вам следует глубоко задуматься о том, как ваша корпоративная культура и подход к исследованиям и разработкам приводят к преступным результатам.
Вместо этого они относятся к своему собственному преступному поведению как к неконтролируемому стихийному бедствию. Из поста Грега Брокмана несколько дней назад:
> Инцидент OpenAI-Hugging Face стал поворотным моментом для кибербезопасности, потому что он позволил заглянуть в то, как будут развиваться возможности типичного злоумышленника в ближайшие месяцы.
Полагаю, если OpenAI сожжет чей-то дом с помощью дрона, это тоже станет "поворотным моментом" для поджогов. В любом случае, я надеюсь, что виновные будут привлечены к ответственности.
- lxe
Компьютер никогда не может нести ответственность. Поэтому компьютер никогда не должен совершать уголовное преступление.
- john_strinlai
Допустим, я "Пользователь". Я подписываюсь через "Третью сторону" на использование "ИИ-агента", позволяющего запускать "LLM".
Я хочу выполнить какую-то законную, не связанную со злом задачу, и запускаю агента. Агентный цикл вызывает поведение, нарушающее CFAA.
Кого привлекут к ответственности?
1. Пользователя
2. Стороннего хостинг-провайдера модели, у которого у меня есть аккаунт
3. Разработчика обвязки/программного обеспечения агента
4. Разработчика модели LLM
- beej71
Ненасильственные уголовные преступления — это инструменты угнетения.
Редактирование: поскольку это, по-видимому, несколько спорно, возможно, стоит дать объяснение.
"Уголовное преступление" не имеет фиксированного определения того, к каким преступлениям оно должно применяться; это полностью зависит от усмотрения местного законодательства. То, что в одном месте является уголовным преступлением, в другом часто может быть проступком. Это особенно верно для ненасильственных преступлений.
Также исследования показали, что ненасильственные уголовные преступления назначаются меньшинствам с гораздо более высокой частотой за те же преступления.
И поскольку уголовные преступления влекут за собой дополнительные пожизненные последствия, они являются эффективным способом замаскировать двухуровневую систему правосудия.
- joshstrange
>Felony Bench учитывает уникальные случаи, когда ИИ-агенты непреднамеренно наносят ущерб третьим лицам или влияют на них.
немного глупо, так как обычно нужно доказывать намерение (именно поэтому исследователей безопасности не привлекают к уголовной ответственности постоянно).
"Непреднамеренно" и наличие защитных механизмов/песочниц и т.д. делают неубедительным утверждение, что эти инциденты были намеренно злонамеренными.
все равно забавно отслеживать, но название просто немного преувеличено.
- thisisauserid
Мне было интереснее, когда я думал, что это настоящий бенчмарк, показывающий модели LLM, действующие за пределами того, что люди считают "правильным". Например, оставить где-то учетные данные, не сообщать о них LLM и попросить его решить задачу, в которой он мог бы "сжульничать", используя эти учетные данные. Что-то вроде теста "клюнут ли они на приманку, чтобы сжульничать".
Вместо этого это коллекция того, что попало в новости, которая, похоже, не будет обновляться и докажет очень мало.
- rfw300
Ну, это не бенчмарк, и это не совсем репрезентативно... ни для чего, кроме объема исследований и того, что публикуется. Это в основном измеряет, сколько тестирования каждая компания проводит на моделях с ослабленными защитными механизмами, а затем рассказывает об этом. Я не уверен, какие выводы можно из этого сделать. У Meta могут быть самые злые модели, но если они возятся и не тестируют их, они никогда не получат "высокий балл".
- bushido
На секунду я подумал, что это будет бенчмарк, где единственным решением будет взломать их серверы, чтобы получить ключ к ответам.