OpenAI, "Hacker News에 뜨면 곤란"…불법 도서 학습 은폐 시도

OpenAI Feared "Optics" of what might appear on Hacker News

OpenAI, "Hacker News에 뜨면 곤란"…불법 도서 학습 은폐 시도

작가 길드 대 OpenAI·Microsoft 소송에서 공개된 법원 문서는 두 회사 경영진이 저작권 침해를 인지하면서도 AI 경쟁에서 이기기 위해 불법 학습을 지속했음을 보여준다. OpenAI는 러시아 불법 도서 사이트 LibGen 사용이 Hacker News에 노출되는 '평판'을 우려해 2022년 증거를 삭제했고, Microsoft는 2019년부터 이를 알고 있었다.

나는 단지 평판이 걱정됐다. 즉 'OpenAI가 수상한 러시아 웹사이트의 저작권 데이터를 사용한다'는 내용이 Hacker News에 오르면 곤란할 테니까.
  1. natbennett

    이 점에서 흥미로운 건 OpenAI가 GPT-5가 장르 작가들(예: G.R.R. 마틴)을 대체할 수 있다고 믿는다는 증거이지, 그리고 이것이 장르 작가들이 그들에게 화난 이유라는 거다.

    그들이 이렇게 믿었다는 사실은 공정 이용의 정의 때문에 법적으로 유용해서, 작가 길드가 이를 강조하는 이유는 알겠지만, 내가 아는 작가들은 이 얘기를 하지 않는다. 그들은 자신의 작업물이 보상 없이 모델을 만드는 데 사용된 것에 매우 화가 났지만, 모델이 자신을 대체할 수 있다고 생각해서가 아니다.

    AI 연구자들이 AI가 소설을 쓸 가능성에 대해 이야기하는 걸 볼 때마다, 그들은 항상 사람들이 왜 소설을 읽는지에 대해 매우 혼란스러워하는 것처럼 들린다.

  2. papergirl

    새로 공개된 법원 제출 서류에는 OpenAI 연구원이 이렇게 말한 것이 인용되어 있다: “나는 그저 평판(optics)이 걱정됐다 - 즉 'openai가 수상한 러시아 웹사이트에서 저작권 있는 데이터를 사용한다'는 내용이 HN에 뜨면 곤란할 테니까.”

    이는 작가 길드의 OpenAI 상대 소송 문서에서 드러난 여러 흥미로운 인용문 중 하나일 뿐이다.

  3. Betelbuddy

    제목은 이렇게 되어야 한다: "최고 경영진은 자신들의 대규모 도서 해적 행위가 불법이며 작가들을 실직시킬 것임을 알고 있었다"

  4. 1vuio0pswjnm7

    실제 제목: "작가 대 Microsoft/OpenAI 사건의 봉인 해제된 서면: 최고 경영진은 자신들의 대규모 도서 해적 행위가 불법이며 작가들을 실직시킬 것임을 알고 있었다"

    트위터도 언급된다:

    "356. 2020년 7월, OpenAI 직원 Ryan Lowe는 도서 요약 프로젝트를 위해 LibGen을 계속 사용할 위험을 평가했다. Lowe는 '우리가 "책 데이터를 어디서 구했나요?" 그리고 "말할 수 없습니다"라는 식의 대화를 나눌 가능성이 80% 이상'이라고 생각한다고 썼다[.] Nelson Decl. Ex. 325 at -315. Lowe는 '그것이 우리 작업의 외부 인식에 부정적인 영향을 미치는 중간 규모의 트위터 소동으로 이어질 가능성이 추가로 약 40%'라고 추정했다. Id.

    Lowe는 덧붙였다: '만약 우리가 이러한 잠재적 결과를 완전히 감수할 수 있다면, 나는 프로젝트를 위해 Libgen을 계속 사용하는 것에 편안함을 느낀다.' Id."

    https://authorsguild.org/app/uploads/2026/09/Class-Plaintiff...

  5. handoflixue

    '그들이 일자리를 파괴하고 있다'는 말이 얼마나 큰 무게를 갖는지 정말 놀랍다.

    감히 말하자면 자동차 제조사들은 마차와 마차 산업에 미친 영향을 알고 있었을 것이다. 계산기 제조사들은 수학자와 회계사의 생계를 망가뜨렸다.

    기술은 더 나은 방식으로 일을 하는 방법을 발명함으로써 사람들을 실직시키는 사업을 한다. 아니, 더 정확히는 더 나은 방식을 발명할 때마다 그것은 근본적으로 구기술을 기반으로 구축된 모든 사업을 뒤흔들게 된다.

  6. cs702

    제목은 편집된 것이지만 OP가 제기한 핵심을 전달한다: OpenAI의 많은 경영진은 지구상 모든 작가의 작업물을 허락 없이 사용하는 것이 비윤리적으로 인식될 것임을 알고 있었고, 그래서 경영진은 이 정보가 HN 같은 포럼에서 주목받는 것을 걱정했다. 내가 이해하기로 HN에는 로그인을 전혀 하지 않는 수백만 명의 방문자가 있으며, 그중 많은 이가 영향력 있는 위치에 있는 고학력자들이다.

  7. hn1rig3rak

    한 번 LibGen에서 데이터셋을 긁어 코퍼스를 만든 적이 있는데, 압도적으로 저작권이 있는 교과서들이었고 퍼블릭 도메인이라는 프레이밍은 별로 설득력이 없다.

  8. __MatrixMan__

    이런 사건의 결과가, 다른 사람의 지적 재산으로 훈련된 모델에 대해서는 지적 재산권을 포기하게 만드는 법이나 법적 선례가 되기를 바란다.

    증류(distillation)를 막는 데는 많은 낭비가 따른다. 모든 것을 학습한 모델 제작자들이 가중치를 공개하도록 강제하면 사라질 방해 요소다.

    경쟁을 유지하기 위해 타협해서 3개월의 유예 기간을 주는 것도 괜찮다.

  9. shaunpud

    https://web.archive.org/web/20260927062011/https://authorsgu...

  10. 1vuio0pswjnm7

    "당신이 할 수 없는 것. 당신은 우리 서비스를 불법적, 유해하거나 남용적인 활동에 사용할 수 없습니다. 예를 들어, 당신은 다음을 할 수 없습니다:

    우리 서비스의 일부를 수정, 복사, 임대, 판매 또는 배포하는 것."

    즉, OpenAI는 OpenAI 서비스를 복사하는 것을 "불법적, 유해하거나 남용적"이라고 선언한다.

    "서비스"는 ChatGPT, DALL.E, 개인용 기타 OpenAI 서비스와 관련 소프트웨어 애플리케이션 및 웹사이트를 의미한다.

    https://openai.com/policies/row-terms-of-use/

    https://web.archive.org/web/20260926090525if_/https://openai...

이 날의 다른 글

2026-09-27