Amazon 撕书喂 AI,Internet Archive 却遭起诉
It is a sign of the times that Amazon gets to call this fair use
404 Media 最新调查揭露,Amazon 正大规模收购书籍,在拉斯维加斯的仓库中撕毁装订以快速获取 AI 训练数据,随后将书籍销毁。这种为了训练 Nova 系列模型而进行的破坏性扫描,被作者称为大规模知识产权盗窃。与之形成鲜明对比的是,Internet Archive 坚持逐页数字化,绝不破坏书籍的物理完整性,却面临大型企业的诉讼威胁。文章指出,Amazon 选择这种廉价但破坏性的方式,如同选择化石燃料而非可再生能源,是出于短期利益的主动选择,而非技术无奈。
在 Internet Archive,我们绝不会通过切断装订来销毁书籍,而是选择更艰难的方式,逐页进行数字化。
HN 评论区
90- areoform
我觉得这种倒果为因的推理令人印象深刻。
在我出生之前,版权法几乎已经扼杀了公有领域。如今一切变得陈腐且千篇一律。
这场特定的战役在 Google Books 试图建立世界上最大的图书馆——现代亚历山大图书馆——时就已经输了。
但随后版权律师们介入,要榨取他们的一杯羹。于是我们便落得这般田地。
我对知识的毁灭感到愤慨。纸张是比任何硬盘都优越的存储介质,无论何时。我们都能从一千多年前的纸张上恢复文字。我认为,不与非营利组织合作、不使用廉价的现成非破坏性扫描设备、不将重新装订和重新存放的成本计入亏损,是一个错误。
所有人的目光都短浅得令人咋舌。
- Dylan16807
版权法似乎更偏爱这种破坏性的方式。问题不在于他们是在规避法律,而是法律本身从一开始就制定得极其糟糕。
- WalterGR
文章中引用的 404 Media 报道已在此提交:https://news.ycombinator.com/item?id=49330742
“我们追踪了一批珍本书的运输。它们最终抵达了亚马逊的 AI 训练设施”(404media.co)
164 分 | 3 天前 | 321 条评论
- sonicrocketman
原标题(太长):这个时代的一个标志是,亚马逊可以声称这是合理使用,而大型公司却试图起诉 Internet Archive 直至其破产。
- schoen
这在版权法理论上其实并非完全荒谬。一些法院认为,在受版权保护的作品上进行 AI 训练属于“转换性”使用(在合理使用分析中传统上受更多保护),而向人类提供作品访问则属于“消耗性”使用(传统上受较少保护)。
此外,合理使用考量中还有倾向于非商业用途而非商业用途的因素,但这并非唯一问题,且法律条文并未明确说明如何综合考量这些合理使用因素。
但在《版权法》下,确实可能存在这样的情况:某些商业用途的受版权保护作品可被视为合理使用,而某些非商业用途同时却不能被视为合理使用。