AI 公司销毁纸质书,Anna's Archive 紧急行动

AI companies destroy physical books – let's scan rare books before it's too late

AI 公司正秘密收购并销毁数百万纸质书,只为获取 2022 年前的纯净训练数据。Anthropic 的 Project Panama 项目耗资数千万美元购买书籍,扫描后训练 Claude LLM,随即销毁实体书,将知识永久垄断在私有服务器上。这不仅是商业竞争,更是对人类文化遗产的侵蚀。Anna's Archive 呼吁全球志愿者加入,扫描并上传稀有书籍、期刊和古籍,构建数字亚历山大图书馆。如果未来互联网内容大半由 AI 生成,人类将如何区分真实与虚构?这是一场与时间的赛跑,我们需要在知识被彻底封锁前,保存人类文明的火种。

一旦 AI 吸收了人类在纸上写下的最后一句话,互联网上将只剩下 AI 自己的话语。
  1. ezfe

    我讨厌这些 AI 公司,但我们要说清楚:是版权持有者把这些书锁起来的。如果他们不想再印更多副本,大可以放弃这些书的版权。

    相反,他们却执行版权法,迫使 AI 公司粉碎他们想要摄入的书籍。

    编辑:另外,AI 公司只会购买、扫描并销毁一本书一次。按理说,很多书都有不止一本副本。

  2. HedonicEscal8r

    盗版组织们正在下四维国际象棋,而其他人还在玩跳棋。整个局势的讽刺之处在于——AI 公司因卡夫卡式的版权法被法律要求粉碎书籍,结果这却被 Anna's Archive 用作营销手段——这简直是一件艺术品。

    顺便说一句,我支持 Anna's Archive。信息应当自由。

  3. skeledrew

    也许这里有点循环论证。如果一本实体书很稀有,那是否意味着它从一开始就没有多少人能接触到?在我看来,通过 LLM 提供其知识,哪怕是由一家私营公司来做,也比让它孤零零地待在某个图书馆里可能只被几个人阅读,或者更糟,被锁在某个私人收藏家的藏品里,要惠及更多人。

    我忍不住觉得,这种呼吁对 AI 公司感到愤慨并要求现在扫描书籍的呼声,似乎有些虚伪或别的什么。以前当这些书还主要被锁在世界之外时,怎么没人这么说?只有当它们真正开始向——至少是部分——更广阔的世界开放时,它们才成了值得保护的“文化遗产”。真是遗憾。

  4. tgsovlerkhgsel

    实体书和数字内容的特殊性在于,你几乎可以以低廉的成本永久归档它们的内容。建筑物、绘画、神像、生物、自然环境特征……就没那么容易了。

    所以解决方案是:

    - 强制进行版权登记和续期,并链接到可以获取该作品的位置

    - 为任何非商业性质的信托类组织提供一个通用的豁免条款,使它们能够扫描书籍等并将数据保留在自己的服务器上。它们应该可以收取费用发放数字会员卡,让赞助人访问这些档案。任何在注册数据库中显示为“活跃”的作品都将被锁定。所有“死亡”材料都可以与会员共享。

    通过这种方式,可以涌现出成百上千个数字保存协会。

  5. sieve

    挺搞笑的是,他们直接把 Anna's Archive 拿过来摄入数据了。

    至于这个故事:他们把话说得好像是 AI 公司买下了所有现存的稀有书副本并窃取知识,但据我所知,事实并非如此。

  6. glimshe

    第一段非常迷人:“几家 AI 公司正通过中间商收购大量二手书,扫描并销毁它们,以获取 2022 年之前‘未经机器触碰’的训练数据。”

    人类知识的语料库对于高质量 AI 训练来说,现在本质上是不是已经定格在时间中了?此外,除了帮助 AI 获取历史知识外,旧书对 AI 训练到底有多大用处?

  7. xvxvx

    我高度怀疑他们在扫描后并没有销毁这些书的数字副本。他们肯定希望未来的模型也能在同样的内容上训练。那么,是什么阻止他们将这些数字副本向公众开放呢?是版权!

  8. jupp0r

    我完全相信,关于 AI 公司销毁书籍的争议,正是这些公司自己煽动起来的。

    版权法要求,如果你改变了格式(format shift),就必须销毁原书。如果你进行了数字化,就必须确保它不是一份“副本”,而是你原本的那本授权随书转移了。

    所以……如果有足够多的人抱怨,他们就能施压要求修改版权法。而这恰好会包含巨大的豁免条款,让他们为所欲为。

同日更多故事

2026-08-21