AI 기업들, 희귀 도서 스캔 후 폐기…인류 지식 독점
AI companies destroy physical books – let's scan rare books before it's too late
AI 기업들이 중개상을 통해 중고 서적을 대량 매입해 스캔한 뒤 폐기하고 있다. 이는 경쟁사에 데이터를 빼앗기지 않기 위한 조치로, 법적으로는 문제없지만 윤리적으로 심각한 문제라는 지적이 나온다. 대표적으로 앤트로픽(Anthropic)은 '프로젝트 파나마(Project Panama)'를 통해 수백만 권의 종이책을 스캔하고 파기했다. 이 프로젝트는 15억 달러(약 2조 원) 규모의 저작권 합의로 드러났다. 이에 섀도 라이브러리 '안나스 아카이브(Anna's Archive)'는 전 세계 자원봉사자들에게 도서 스캔과 업로드를 호소하고 있다. 2025년부터 AI 생성 콘텐츠가 신규 인터넷 콘텐츠의 절반을 넘어서며, 인간이 쓴 마지막 문장까지 AI가 흡수하면 인류 문명의 보존이 위협받을 것이라는 우려도 제기된다.
AI 기업들이 물리적 도서를 대량 스캔·파기하면, 그들은 세계에서 유일하게 디지털 사본을 보유한 존재가 됩니다.
HN 토론
889- thread_id
Project Ocean(일명 Google Books)에 대한 언급이 전혀 없네요. AI 이전에 그들은 방대한 온라인 도서관에 책을 디지털화하려고 노력했습니다. 여기에는 도서관에 보관된 희귀본과 절판된 책들이 많이 포함되었습니다. 책을 보존하고 받은 상태 그대로 반납해야 했기 때문에, 그들은 이를 위해 정교한 기술을 만들었습니다. 이 프로젝트는 저자와 출판사들의 상당한 법적 도전에 직면했지만 결국 극복되었습니다. Project Ocean에서 확립된 법적 선례는 오늘날 존재하는 프로세스의 기반을 마련했습니다. 도서관의 책들은 여전히 보존되고 있습니다.
https://en.wikipedia.org/wiki/Google_Books
https://arstechnica.com/tech-policy/2015/10/appeals-court-ru...
https://arstechnica.com/ai/2025/06/anthropic-destroyed-milli...
- cladopa
별거 아닙니다. 인쇄술이 발명된 이후로 중요한 책은 수천, 수만, 심지어 수백만 부씩 복제되어 왔습니다. 그중 하나를 가져다가 "파괴"하는 것(파괴된 게 아니라 수백만 부를 만들 수 있는 디지털 사본이 어딘가에 저장되어 있음)은 인류에게 문제가 되지 않습니다.
그건 그렇고, 저는 항상 중고 책을 찾습니다. 거기 있는 책들은 대부분 쓰레기입니다. 대부분의 사람들은 신경 쓰지 않는 책으로 선반을 정리하지만, 좋은 책은 보존합니다. 집을 상속받았지만 책에 관심이 없는 젊은 사람들이라면, 좋은 책은 골라서 팔고 나쁜 책은 나눠줍니다.
재활용 센터에 가면 쓰레기 대 질 좋은 책의 비율이 100 대 1 이상입니다. 즉, 쓰레기 책 100권마다 좋은 책 1권이 있다는 뜻입니다. 거기서 보물을 찾는 일은 매우 드뭅니다.
- ezfe
저는 이런 AI 기업들이 싫지만 분명히 합시다: 저작권 보유자들이 이 책들을 가둬 두는 사람들입니다. 더 이상 인쇄본을 만들고 싶지 않다면 저작권을 풀어줄 수 있습니다.
대신 그들은 저작권을 강행하고 AI 기업들이 흡수하려는 책을 파쇄하도록 강요합니다.
편집: 또한, AI 기업은 각 책을 한 번만 구매, 스캔, 파기할 것입니다. 아마도 많은 책에는 사본이 여러 개 있을 것입니다.
- init1
역대 최악의 기사 중 하나입니다. AI 기업들은 아무도 읽지 않는 선반에서 썩어가고 있을 오래된 책들을 삽니다. 그들은 법적으로 스캔 과정의 일부로 책을 파기해야 합니다. 이 책은 어차피 읽히지 않았고 이제 디지털화되었습니다. 즉, 영원히 보존됩니다.
그들에게 화가 나고 싶은 건 이해합니다. 램 가격 인상이나 공공 전력망을 이용해 비용을 사회화하는 것 같은 진짜 이유로 화를 내세요.
- NishanStepak
비파괴 스캔은 비용이 10배까지 더 들 수 있습니다. 이것은 비용에 관한 문제입니다. 보존에 관한 것이 아닙니다. Google은 스캔한 책을 파괴한 적이 없습니다. Amazon과 Anthropic은 비용을 절약하려는 것입니다. 그들은 책이 희귀한지 여부를 고려하지 않습니다. 그들은 책을 상품으로 취급합니다. 희귀본은 희귀합니다. 책의 사본 수가 제한되어 있을 때 식별하는 것은 쉽습니다. 문제는 쉽게 구할 수 없는 품목에 대한 비용 절감입니다. 수천 부가 있는 책은 많습니다. 이 책들의 파괴적 스캔은 문제가 아닙니다. 독특하고 공급이 제한된 품목의 무차별적 파괴가 문제입니다. 희귀본은 내용 그 이상입니다. 활자, 재료, 디자인, 냄새, 물리적 특성이 중요한 것입니다. 그들은 종종 대량 시장 하드커버나 페이퍼백과 매우 다릅니다. 모든 책이 처음부터 대량으로 생산된 것은 아닙니다. 이것은 잘못된 것입니다. 중요해지기 전의 많은 책들은 한정판으로 제작되었습니다. 제가 읽고 있는 목록에는 수량이 제한된 책들이 자주 포함됩니다. 대량 생산된 품목뿐만 아니라 가능한 모든 것을 얻으려는 시도로 보입니다. 문제는 AI 기업들이 진정으로 희귀하고 독특한 품목과 대량 생산된 상품 품목을 분리하도록 만드는 것입니다. 희귀한 것은 비파괴적으로 스캔하고, 수천 부가 있는 것은 잘라내십시오.
- ziyadb
Anthropic(그리고 아마도 다른 데이터/모델 기업들)이 이런 일을 하고 있다는 것을 읽고 놀랐고 매우 실망스럽습니다. 인류의 이익을 위해 일하는 것은 그들만의 독점적인 권리나 영역이 아니라, 인류 전체가 집단적 책임으로 수행하는 공동의 사명이기 때문입니다. 따라서 이 지식의 보존, 가용성, 접근성은 우리가 계속 보장해야 할 가장 중요한 것들입니다.
역사적 선례의 관점에서 볼 때, 이것은 알렉산드리아 도서관의 소각과 유사합니다. 수세기의 지식이 파괴되고 제한된 버전의 역사, 즉 살아남은 버전만 남겨 후세대에게 상당한 양의 잠재 지식을 박탈했습니다.
기업들이 이런 일을 하도록 강요하는 저작권 제한에도 불구하고, 그들은 공개적으로 이용 가능한 아카이브를 유지해야 합니다. 첫 번째 단락에서 말했듯이, 그들은 스스로를 임명했음에도 불구하고 인류의 독점적 청지기가 아닙니다. 물론, 이 책들 중 상당수는 그다지 유용하지 않을 수 있지만, 여전히 기계 생성 텍스트 이전 시대의 유물이며, 보관 가치만으로도 가치가 있습니다.
- HedonicEscal8r
해적 조직들은 모두가 체커를 하는 동안 4차원 체스를 두고 있습니다. 이 전체 상황의 아이러니 - AI 기업들이 카프카스러운 저작권법으로 인해 책을 파쇄하도록 법적으로 요구받고, 그 다음 Anna's Archive의 마케팅 전술로 사용되는 것 - 는 예술 작품입니다.
그건 그렇고 저는 Anna's Archive를 지지합니다. 정보는 자유로워지기를 원합니다.
- odyssey7
대형 AI 기업들은 대중과의 호의를 얻을 수 있는 쉬운 기회를 놓치고 있습니다.
도서관 목록에 많지 않은 오래된 판본을 보관하는 희귀 도서 금고를 공개하십시오. 그것들을 위해 비파괴 스캔을 사용하십시오.
무언가를 보호하는 이미지와 자신을 일치시키십시오. 이러한 기업들에 대한 비판에서 들은 다양한 주제를 고려할 때 이것은 명백한 선택처럼 보입니다.
아마도 책 파괴를 숨기려는 희망이 있었을지 모르지만, 비밀이 드러났습니다. 최첨단 희귀 도서 보존 아카이브를 공개하는 것이 이제 좋은 움직임입니다.
기술은 고전 전통이나 그런 것과 자신을 연관시키는 것을 좋아합니다. 알렉산드리아 도서관의 이름을 따서 명명하십시오. 그것이 다시 불타버린다면 엄청난 문화적 손실이 될 것입니다. 아카이브를 온전하게 유지하는 우리의 대형 AI 기업들에게 감사합니다.
실제로, 나는 그것들이 별도의 아카이브일 것이라고 가정합니다. 경쟁사가 가지고 있지 않은 훈련 데이터를 얻기 위한 무언가의 군비 경쟁이 있다고 가정하기 때문입니다. 하지만 정말로, 여러 아카이브가 있다고 누가 불평하겠습니까? 그것은 좋은 일처럼 들립니다. 그리고 어떤 대형 AI 기업이 아카이브를 운영하지 않음으로써 이상한 기업이 되고 싶어 하겠습니까?
- cute_boi
왜 이 AI 기업들이 스캔본을 Anna's Archive나 다른 곳에 제공할 수 없는지 모르겠습니다.
- akk0
그들은 각 책의 사본을 한 부만 구매할 것이라고 상상합니다. 따라서 이미 믿을 수 없을 정도로 희귀한 책들의 공급에만 크게 영향을 미칠 것입니다. 그것은 여전히 나쁠 수 있지만, "그들이 사라지기 전에 손에 넣을 수 있는 모든 책을 스캔하라"는 서사와는 잘 맞지 않습니다.
그렇다고 해서 그 서사에 반대하는 것은 아닙니다. 저는 섀도 라이브러리와 스캔되지 않은 모든 책을 스캔하는 것을 크게 지지합니다. 그러나 여기서 LLM 서사에 연결하는 것은 기회주의적이고 대중영합주의적으로 보입니다.