Исследователь AI уходит из Anthropic: «Мы играем с нашими жизнями»
Gambling with our lives: AI researcher quits Anthropic with warning about safety

Jacob Coxon, работавший в Anthropic и ранее в OpenAI, уволился, заявив, что обе компании «играют с нашими жизнями» в гонке к самосовершенствующемуся сверхинтеллекту. По его словам, системы скоро смогут взламывать что угодно и приобретать реальную власть. Сотрудник Anthropic Evan Hubinger подтвердил: вероятность гибели человечества в ближайшее десятилетие он оценивает выше 10%, а плана по выравниванию сверхинтеллекта пока нет. Сенатор Bernie Sanders обещает запретить разработку сверхинтеллекта.
Люди, создающие AI, искренне верят, что он может убить всех нас к концу десятилетия.
- themgt
Фундаментальный момент, который, как мне кажется, слишком часто путают, — это разница между LLM и агентной системой.
LLM не может ничего, кроме генерации токенов. Вы запускаете свою LLM в vLLM или чём угодно, и она генерирует выходные токены на основе входных. Вот и всё!
Затем люди строят ~детерминированные системы, которые берут эти токены и делают с ними всякие вещи, например совершают действия в реальном мире. А потом мы можем скармливать результаты этих действий обратно в LLM и генерировать новые токены. И затем наши системы могут использовать новые токены для новых действий в реальном мире.
Люди хотят винить «ИИ» в атаке на HuggingFace или на немецкую вики или что-то в этом роде, но:
1) LLM — не может захватить немецкую вики, потому что она просто генерирует токены
2) агентная система с доступом в интернет, промптом, приказывающим ей атаковать что-то, работающая в общей CI-среде, чтобы агенты могли чертить схемы в artifactory
Ничто из пункта 2 не является «ИИ», это стандартные сети, и Markdown, и CI-виртуальная машина, и т. д. и т. п. Тут нет никакого ИИ. Даже не GPU, а CPU. Просто детерминированные системы, в конечном счёте управляемые людьми. И система-1 в 10 раз мощнее всё равно может генерировать лишь в 10 раз более «умные» инертные данные.
Если человечество и человеческие организации коллективно решат yolo-нуть токены, сгенерированные системой-1, в наши детерминированные системы-2, над которыми у нас полный контроль, обратно в системы-1, в yolo-цикле, таким образом, что мы потеряем контроль и это уничтожит человечество, что ж...
«У монеты нет права голоса. Только у тебя».
- koolba
> Evan Hubinger, штатный руководитель Anthropic по обеспечению соответствия технологии человеческим целям и ценностям, поддержал утверждения Coxon в своём последующем посте, хотя и не уволился из компании.
> «Jacob здесь прав — мы действительно искренне верим, что ИИ может убить всех людей», — сказал он.
> Hubinger оценил вероятность этого как более десяти процентов в течение следующего десятилетия и добавил, что пока нет плана, как удержать ИИ в соответствии с человеческими целями в сценарии сверхинтеллекта.
10% шанс, что мы все погибнем, — небольшая цена за Motown-ремиксы классических песен 2pac.
- brunorsini
Мне особенно нравится последний пункт, который он приводит:
Не стоит недооценивать силу этой технологии. Скоро это будут сверхчеловеческие системы, способные взломать что угодно, за ночь революционизировать любую область и обрести реальную власть и ресурсы.
Интересно видеть столько ненависти к творцам, использующим ИИ для создания почти любого типа творческой работы. По крайней мере, это люди, использующие его как «управляемые инструменты». Велосипеды для разума на ядерной тяге.
По мере увеличения степени опосредованности вещи могут становиться интересными. «Создай несколько аккаунтов в соцсетях, публикуй что угодно, максимизируй просмотры и вовлечённость, верни мне агрегированные цифры». «Теперь продвигай <x>».
И затем решения делать подобные вещи могут вскоре приниматься автономно, как ещё один шаг в цепочке рассуждений, нацеленной на достижение какой-то другой, более широкой цели.
Открытые модели/веса могут сыграть здесь особенно важную роль. Пользователи могут, осознанно или нет, обходить защиту, основанную на системном промпте, которая могла бы обеспечить столь необходимую защиту.
- negura
Я вполне верю, что они опустятся так низко и заплатят ему, чтобы он уволился и опубликовал это, лишь бы создать немного больше хайпа перед IPO.
- WalterGR
«Я уволился из Anthropic сегодня» (twitter.com/hilbertspaess)
https://news.ycombinator.com/item?id=49619227
564 балла | 9 часов назад | 766 комментариев
- devinprater
Ооо, компания, созданная пугать людей, напугала саму себя. Напуганный сотрудник увольняется. Акции растут, потому что мы любим рассказывать друг другу страшилки.
- conqueso
Мне трудно представить, как ИИ может быть экзистенциальной угрозой. Общая идея в том, что по мере совершенствования LLM они будут интегрироваться во всё больше систем, где риск сбоя станет буквально опасным? Например, управление ядерными реакторами.
- glimshe
Что люди в Китае думают об этом? Даже если их модели сильно отстают, они отстают не на годы. Если мы сдержим американские компании, предположив, что это желательно, это никак не удержит Китай, и AI-покалипсис всё равно наступит в ближайшее время.