AI 公司销毁纸质书,Anna's Archive 紧急行动
AI companies destroy physical books – let's scan rare books before it's too late
AI 公司正秘密收购并销毁数百万纸质书,只为获取 2022 年前的纯净训练数据。Anthropic 的 Project Panama 项目耗资数千万美元购买书籍,扫描后训练 Claude LLM,随即销毁实体书,将知识永久垄断在私有服务器上。这不仅是商业竞争,更是对人类文化遗产的侵蚀。Anna's Archive 呼吁全球志愿者加入,扫描并上传稀有书籍、期刊和古籍,构建数字亚历山大图书馆。如果未来互联网内容大半由 AI 生成,人类将如何区分真实与虚构?这是一场与时间的赛跑,我们需要在知识被彻底封锁前,保存人类文明的火种。
一旦 AI 吸收了人类在纸上写下的最后一句话,互联网上将只剩下 AI 自己的话语。
HN 评论区
889- ezfe
我讨厌这些 AI 公司,但我们要说清楚:是版权持有者把这些书锁起来的。如果他们不想再印更多副本,大可以放弃这些书的版权。
相反,他们却执行版权法,迫使 AI 公司粉碎他们想要摄入的书籍。
编辑:另外,AI 公司只会购买、扫描并销毁一本书一次。按理说,很多书都有不止一本副本。
- HedonicEscal8r
盗版组织们正在下四维国际象棋,而其他人还在玩跳棋。整个局势的讽刺之处在于——AI 公司因卡夫卡式的版权法被法律要求粉碎书籍,结果这却被 Anna's Archive 用作营销手段——这简直是一件艺术品。
顺便说一句,我支持 Anna's Archive。信息应当自由。
- skeledrew
也许这里有点循环论证。如果一本实体书很稀有,那是否意味着它从一开始就没有多少人能接触到?在我看来,通过 LLM 提供其知识,哪怕是由一家私营公司来做,也比让它孤零零地待在某个图书馆里可能只被几个人阅读,或者更糟,被锁在某个私人收藏家的藏品里,要惠及更多人。
我忍不住觉得,这种呼吁对 AI 公司感到愤慨并要求现在扫描书籍的呼声,似乎有些虚伪或别的什么。以前当这些书还主要被锁在世界之外时,怎么没人这么说?只有当它们真正开始向——至少是部分——更广阔的世界开放时,它们才成了值得保护的“文化遗产”。真是遗憾。
- tgsovlerkhgsel
实体书和数字内容的特殊性在于,你几乎可以以低廉的成本永久归档它们的内容。建筑物、绘画、神像、生物、自然环境特征……就没那么容易了。
所以解决方案是:
- 强制进行版权登记和续期,并链接到可以获取该作品的位置
- 为任何非商业性质的信托类组织提供一个通用的豁免条款,使它们能够扫描书籍等并将数据保留在自己的服务器上。它们应该可以收取费用发放数字会员卡,让赞助人访问这些档案。任何在注册数据库中显示为“活跃”的作品都将被锁定。所有“死亡”材料都可以与会员共享。
通过这种方式,可以涌现出成百上千个数字保存协会。
- sieve
挺搞笑的是,他们直接把 Anna's Archive 拿过来摄入数据了。
至于这个故事:他们把话说得好像是 AI 公司买下了所有现存的稀有书副本并窃取知识,但据我所知,事实并非如此。
- glimshe
第一段非常迷人:“几家 AI 公司正通过中间商收购大量二手书,扫描并销毁它们,以获取 2022 年之前‘未经机器触碰’的训练数据。”
人类知识的语料库对于高质量 AI 训练来说,现在本质上是不是已经定格在时间中了?此外,除了帮助 AI 获取历史知识外,旧书对 AI 训练到底有多大用处?
- xvxvx
我高度怀疑他们在扫描后并没有销毁这些书的数字副本。他们肯定希望未来的模型也能在同样的内容上训练。那么,是什么阻止他们将这些数字副本向公众开放呢?是版权!
- jupp0r
我完全相信,关于 AI 公司销毁书籍的争议,正是这些公司自己煽动起来的。
版权法要求,如果你改变了格式(format shift),就必须销毁原书。如果你进行了数字化,就必须确保它不是一份“副本”,而是你原本的那本授权随书转移了。
所以……如果有足够多的人抱怨,他们就能施压要求修改版权法。而这恰好会包含巨大的豁免条款,让他们为所欲为。