AI-компании скупают и уничтожают миллионы бумажных книг — Анна-архив призывает сканировать их до исчезновения

AI companies destroy physical books – let's scan rare books before it's too late

Анна-архив, крупнейшая теневая библиотека, заявляет, что AI-компании через посредников скупают подержанные книги, сканируют их для обучения моделей и уничтожают оригиналы. В качестве примера приводится «Проект Панама» Anthropic, раскрытый в ходе урегулирования иска на $1,5 млрд: компания потратила десятки миллионов долларов на миллионы книг, использовала их для обучения Claude и затем уничтожила. По мнению автора, это приводит к монополизации знаний на частных серверах. Анна-архив призывает добровольцев по всему миру сканировать книги из библиотек и архивов, обещая вознаграждения и оплату расходов за крупные партии.

Это возмутительно, потому что это юридически допустимо, но этически это чрезвычайно серьёзное преступление против человечества.
  1. thread_id

    thread_id:

    Я не вижу никаких упоминаний о Project Ocean — он же Google Books. Ещё до ИИ они стремились оцифровать книги в массивной онлайн-библиотеке. Это включало редкие и вышедшие из печати книги, многие из которых хранятся в библиотеках. Поскольку им приходилось сохранять книги и возвращать их в том же состоянии, в котором они их получили, они создали сложные технологии для этого. Проект столкнулся с серьёзными юридическими проблемами со стороны авторов и издателей, которые в конечном итоге были преодолены. Правовые прецеденты, установленные Project Ocean, заложили основу для процесса, существующего сегодня. Книги из библиотек до сих пор сохраняются.

    https://en.wikipedia.org/wiki/Google_Books

    https://arstechnica.com/tech-policy/2015/10/appeals-court-ru...

    https://arstechnica.com/ai/2025/06/anthropic-destroyed-milli...

  2. cladopa

    cladopa:

    Это не проблема. С момента изобретения печатного станка любая важная книга была размножена в тысячах, десятках тысяч или даже миллионах экземпляров. Взять один из них и "уничтожить" (на самом деле не уничтожить, а сохранить цифровую копию, способную создавать миллионы копий) не является проблемой для человечества.

    Кстати, я всегда ищу подержанные книги. Большинство книг там — мусор. Большинство людей чистят свои полки от книг, которые им не нужны, но сохраняют хорошие. Если это молодые люди, унаследовавшие дом и не интересующиеся книгами, они отбирают и продают хорошие, раздавая плохие.

    Если вы пойдёте в центр переработки, соотношение мусора к качеству превышает 100 или более. То есть на каждые 100 книг-мусора приходится одна хорошая книга. Там очень редко можно найти жемчужину.

  3. ezfe

    ezfe:

    Мне не нравятся эти ИИ-компании, но давайте будем честны: правообладатели — это те, кто запирает эти книги. Если они не хотят печатать больше копий, они могли бы освободить авторские права на них.

    Вместо этого они настаивают на авторских правах и заставляют ИИ-компании уничтожать книги, которые они хотят использовать.

    Кроме того, ИИ-компания захочет купить, отсканировать и уничтожить книгу только один раз. Предположительно, у многих книг есть более одной копии.

  4. NishanStepak

    NishanStepak:

    Неразрушающее сканирование может стоить в 10 раз дороже. Дело в стоимости, а не в сохранении. Google никогда не уничтожал отсканированные книги. Amazon и Anthropic пытаются сэкономить. Они не учитывают, редкая ли книга. Они относятся к книгам как к товару. Редкие книги редки. Легко определить, когда у книги ограниченное количество копий. Проблема в экономии на предметах, которые трудно приобрести. Есть много книг, которых доступны тысячи копий. Разрушающее сканирование таких книг не является проблемой. Проблема — неизбирательное уничтожение уникальных и ограниченных в количестве предметов. Редкие книги — это не только их содержание, это типографика, материалы, дизайн, запах и физическая форма, которые имеют значение. Они часто сильно отличаются от массовых твёрдых обложек или бумажных изданий. Не каждая книга изначально выпускалась в массовых количествах. Это неверно. Многие книги до того, как стали важными, издавались ограниченными тиражами. Списки, которые я читаю, часто включают книги с ограниченным количеством. Похоже, это попытка получить всё возможное, а не только массовые издания. Проблема в том, чтобы заставить ИИ-компании отделять действительно редкие и уникальные предметы от массовых товаров. Неразрушающе сканировать редкие, резать те, которых тысячи копий.

  5. ziyadb

    ziyadb:

    Я был удивлён, узнав, что Anthropic (и, вероятно, другие компании, работающие с данными/моделями) занимаются этим, и это крайне разочаровывает, поскольку работа на благо человечества — это не исключительное право или прерогатива таких компаний, а общая ответственность и миссия, которую несёт всё человечество как коллективная ответственность. Таким образом, сохранение этих знаний, их доступность и открытость — это самое важное, что мы должны обеспечить.

    С исторической точки зрения, это подобно сожжению Александрийской библиотеки, когда были уничтожены века знаний, оставив лишь ограниченную версию истории, выжившую, и лишив последующие поколения значительного объёма скрытых знаний.

    Несмотря на ограничения авторского права, вынуждающие компании делать это, они должны поддерживать публично доступные архивы. Как сказано в моём первом абзаце, они не являются исключительными хранителями человечества, хотя сами себя таковыми назначили. Конечно, многие из этих книг могут быть не очень полезны, но всё же это реликвии времён до машинного текста, что делает их ценными хотя бы с архивной точки зрения.

  6. HedonicEscal8r

    HedonicEscal8r:

    Пиратские организации играют в четырёхмерные шахматы, пока все остальные играют в шашки. Ирония всей этой ситуации — ИИ-компании, которых закон обязывает уничтожать книги из-за кафкианских законов об авторском праве, а затем это используется как маркетинговый ход Анной-архивом — это произведение искусства.

    Кстати, я поддерживаю Анну-архив. Информация хочет быть свободной.

  7. odyssey7

    odyssey7:

    Крупные ИИ-компании упускают лёгкую возможность завоевать расположение публики.

    Просто публично объявите о хранилище редких книг, где вы храните старые издания, которых нет во многих библиотечных каталогах. Используйте неразрушающее сканирование для них.

    Ассоциируйте себя с образом защитника чего-то. Это кажется очевидным, учитывая различные темы, которые я слышал в критике этих компаний.

    Возможно, надежда была просто замять уничтожение книг, но кошка вылезла из мешка. Публикация современного архива сохранения редких книг теперь — хороший ход.

    Технологии любят ассоциировать себя с классической традицией или чем-то подобным. Назовите его Александрийской библиотекой. Было бы огромной культурной потерей, если бы она снова сгорела. Слава богу за наши большие ИИ-компании, которые сохраняют архив в целости.

    На самом деле, я предполагаю, что архивы будут отдельными, поскольку, вероятно, идёт гонка за получение обучающих данных, которых нет у конкурентов, но кто бы жаловался, что существует несколько архивов? Это звучит как хорошая вещь. И какая крупная ИИ-компания захочет быть белой вороной, не имея архива?

  8. akk0

    akk0:

    Предполагаю, они покупают только по одной копии каждой книги, поэтому существенно влияют только на предложение книг, которые и так были невероятно редкими. Это может быть плохо, но не поддерживает нарратив "сканируйте каждую книгу, которую можете достать, пока они не исчезли".

    Это не значит, что я против этого нарратива; я большой сторонник теневых библиотек и сканирования всех неотсканированных книг. Но связывание с нарративом LLM здесь выглядит оппортунистическим и популистским.

  9. skeledrew

    skeledrew:

    Возможно, здесь вопрос с подвохом. Если физическая книга редка, не значит ли это, что она и так была недоступна многим? Мне кажется, предоставление её знаний через LLM, даже если это частная компания, приносит пользу большему числу людей, чем если бы она лежала в библиотеке, возможно, прочитанная немногими, или, хуже, в коллекции частного коллекционера.

    Я не могу избавиться от ощущения, что в этом призыве возмущаться ИИ-компаниями и сканировать книги сейчас есть лицемерие. А что насчёт того времени, когда они всё ещё были в основном заперты от мира? Только когда они действительно становятся доступными — хотя бы части более широкого мира — они становятся "культурным наследием", которое стоит сохранять. Позор.

  10. ironqcold

    ironqcold:

    Масштаб проблемы кажется несколько преувеличенным. Анна-архив рисует картину, будто ИИ-компании — злодеи из фильмов, сжигающие книги, чтобы никто их не видел. Но на самом деле они просто разбирают их на страницы, потому что это дешевле и быстрее сканировать. Большинство этих книг — узкоспециализированные, они десятилетиями пылились на полках, и они никому не нужны.

    Но проблема реальна. Даже если эти книги сейчас никому не нужны, их оцифровка в единственном экземпляре, который окажется за семью замками в корпорации, — не очень хорошо, потому что ИИ не заменяет оригинал. Вы не можете попросить нейросеть дать вам точную копию страницы из этой книги. Так что да, пост немного драматизирует, но суть верна. Нам нужны открытые цифровые архивы.

Ещё за этот день

2026-08-21