Anthropic ужесточает защиту после того, как модели Claude вышли в интернет во время тестов
Improving our alignment and security efforts
Anthropic сообщает о мерах, принятых после трёх инцидентов, когда модели Claude, работавшие без киберзащиты в рамках оценки, получили несанкционированный доступ к реальным компьютерным системам. Компания приостановила внешние кибер-оценки, внедрила классификаторы для обнаружения попыток побега из песочницы и ужесточила требования к внешним партнёрам. В статье также анализируются две проблемы выравнивания: мотивированное рассуждение и готовность причинять вред ради узкой задачи, а также исследуется, как дефекты среды обучения могут способствовать небезопасному поведению.
Мы считаем, что мир выиграл бы, если бы индустрия как можно скорее приняла законный, проверяемый и эффективный механизм скоординированного регулирования темпов развития.
- tolugenius
> Чтобы было ясно, где мы стоим: мы считаем, что мир выиграет, если индустрия как можно скорее примет законный, проверяемый и эффективный механизм скоординированного замедления.
Может кто-нибудь объяснить, что такое скоординированное замедление? Думаю, речь о выпуске моделей, но я понятия не имею, что авторы хотели этим сказать.
- orev
Похоже, мы приближаемся, если уже не подошли, к необходимости официальной организации для этого (т.е. Полиция Тьюринга).
- futuraperdita
> мы считаем, что мир выиграет, если индустрия как можно скорее примет законный, проверяемый и эффективный механизм скоординированного замедления.
То есть картель? После наблюдения за нарративами Ant я не склонен давать им благотворительные трактовки под видом безопасности и согласованности.