OpenAI高管承认:明知侵权仍要取代作家
OpenAI Feared "Optics" of what might appear on Hacker News

Authors Guild v. OpenAI案件最新解封文件揭露了惊人的内部细节。OpenAI和Microsoft的高管早在2019年就清楚知道使用了LibGen等来源的盗版书籍进行训练,并完全预见到这将导致作家失业。内部邮件显示,OpenAI政策总监Jack Clark直言其工作将导致人们失业,而研究负责人Dario Amodei和Sam McCandlish则更担心在Hacker News上出现负面“舆论观感”,而非法律风险。文件还记录了公司试图通过“Project Clear”删除LibGen文件以掩盖证据。这些证据表明,巨头们在AI军备竞赛中,将人类创作者的生存置于“可接受的经济破坏”之下。
OpenAI的GPT模型对写作和出版书籍的人构成了生存威胁。
HN 评论区
565- natbennett
我觉得有意思的是,有证据表明 OpenAI 认为 GPT-5 可以取代类型小说作家(比如 G.R.R. Martin),这也是类型小说作家对他们感到愤怒的原因。
他们之所以这么认为,在法律上是有用的,因为涉及“合理使用”的定义,所以我理解为什么作家工会要强调这一点,但我认识的作家们并不谈论这个。他们非常愤怒,因为他们的作品在未经补偿的情况下被用来训练模型,但这并不是因为他们认为模型能取代他们。
每当我看到 AI 研究人员谈论 AI 写小说的可能性时,他们听起来总是对“人们为什么要读小说”感到非常困惑。
- Betelbuddy
标题应该是:"高管明知大规模图书盗版违法且会让作家失业"
- papergirl
新公布的法庭文件引用了一位 OpenAI 研究人员的说法:"我只是担心舆论影响——也就是说,'OpenAI 使用了来自可疑俄罗斯网站的受版权保护数据'出现在 HN 上会很不幸。"
这只是作家工会起诉 OpenAI 一案中披露的文件里出现的几个有趣引语之一。
- 1vuio0pswjnm7
实际标题:"作家诉微软/OpenAI 案未公开简报:高管明知大规模图书盗版违法且会让作家失业"
还提到了 Twitter:
"356. 2020 年 7 月,OpenAI 员工 Ryan Lowe 评估了继续为图书摘要项目使用 LibGen 的风险。Lowe 写道,他认为'我们有超过 80% 的几率会进行某种形式的交流:"你们的数据是从哪来的?"'以及'我们不能说'。Nelson Decl. Ex. 325 at -315。Lowe 估计'还有大约 40% 的几率会导致一场中等规模的 Twitter 风波,从而对我们工作的外部形象产生负面影响。' Id.
Lowe 补充道:'如果我们完全接受这些潜在结果,那么我乐意继续为该项目使用 Libgen。' Id."
https://authorsguild.org/app/uploads/2026/09/Class-Plaintiff...
- cs702
标题带有编辑色彩,但传达了 OP 的一个关键点:许多 OpenAI 高管知道,未经许可以使用地球上每位作家的作品会被视为不道德,因此高管们担心这一信息会在 HN 等论坛上受到关注。据我所知,HN 有数百万从未登录的访客,其中许多是受过高等教育且身居要职的人士。
- handoflixue
"他们在摧毁工作"这句话的分量之重真是令人咋舌。
我敢说,汽车制造商很清楚他们对马车行业的影响。计算器制造商摧毁了数学家和会计师的生计。
技术的本质就是通过发明更好的做事方式来让人失业。或者更准确地说,只要你发明了更好的做事方式,从根本上就会颠覆所有围绕旧技术建立起来的业务。
- 1vuio0pswjnm7
"你不可以做的事。你不得将我们的服务用于任何非法、有害或滥用的活动。例如,你不得:
修改、复制、租赁、销售或分发我们的任何服务。"
换句话说,OpenAI 声明复制 OpenAI 服务属于"非法、有害或滥用"。
"服务"指 ChatGPT、DALL.E、其他面向个人的 OpenAI 服务,以及任何相关的软件应用程序和网站。
https://openai.com/policies/row-terms-of-use/
https://web.archive.org/web/20260926090525if_/https://openai...
- __MatrixMan__
我希望此类案件的判决结果能形成法律或先例,确保:如果模型是在他人知识产权基础上训练的,则必须放弃该模型的任何知识产权。
阻止蒸馏(distillation)会造成大量浪费。如果我们强制要求这些基于一切数据训练的模型的制作者公开其权重,这种干扰就会消失。
为了保持竞争,也许我们可以妥协,给他们三个月的宽限期。
- hn1rig3rak
曾经从 libgen 拉取数据集构建语料库,结果发现其中绝大多数是受版权保护的教科书,所谓的"公共领域"框架根本站不住脚。
- shaunpud
https://web.archive.org/web/20260927062011/https://authorsgu...