Gentoo Bugzilla 因 AI 爬虫过载关闭

Gentoo bugzilla closed due AI bot scraper overload

Gentoo Bugzilla 因 AI 爬虫过载关闭

我不得不将 Gentoo Bugzilla 暂时关闭,因为它已经被 LLM 爬虫彻底瘫痪。成千上万个不同的 IPv4 地址在疯狂抓取数据,没有任何明显的规律可循。我不是系统管理员,也没有时间处理这种烂摊子,只想专注于真正有价值的工作。面对这种伪装成正常用户、分散在数百万源地址上的滥用行为,传统的防火墙手段几乎失效。如果让 ISP 介入,可能会带来更糟糕的隐私侵犯和连接重置。这场对抗不仅消耗了资源,更让开源社区的基础设施不堪重负。

我没有时间处理这种烂摊子,我只是想做一些有用的工作。
  1. mrweasel

    制造出来的共识。这根本不是 AI,这只是为了勒索而进行的 DDoS 攻击,并且正朝着他们想要的封闭专有互联网发展——那种“只能被认可的 UA 访问”的互联网。否则,你怎么解释身份验证和试图将互联网变成围墙花园在最近几年变得如此盛行?

  2. userbinator

    虽然我们在工作中也面临同样的问题,但我有时仍会好奇这些爬虫究竟是谁。OpenAI、Google、Anthropic 和其他公司通常表现还算得体(除了 Anthropic 试图躲在一家浏览器外包公司背后)。大多数情况下,你可以获取大公司的 IP 段和用户代理,而问题主要来自于伪装成 Chrome 的机器人。

    我们最大的违规者似乎主要集中在东南亚,所以大概是中国 AI 项目居多,但这只是猜测。我也从未见过 Grok 的 IP 段或特定的 Grok 用户代理,但这并不意味着他们在隐藏,也许他们只是没兴趣。

  3. FranOntanaya

    在经历了十年半之后,我们不得不限制公开端并重组旧有的 TED 内容,因为爬虫对各类带字幕的视频需求太旺盛了。如果你的内容对训练有价值,一旦你暴露出来,就会被吞噬殆尽,这就像在夏季苔原上穿短裤一样。

    这将彻底改变我们所熟知的互联网,除非我们 somehow 能就建立一个通用的高质量数据集仓库达成一致。

  4. littlecranky67

    是时候在浏览器中集成微支付了。每访问一个 Bug 报告支付 5 美分。这并不愉快,事情本不该如此,但总比完全没有 Bug 追踪系统要好。

  5. eYrKEC2

    肯定有一些模式可以用来对抗爬虫。这位维护者只是没时间处理,这完全可以理解。

    我们使用 Cloudflare 的负载均衡器将爬虫流量引导至专门的机器人服务器,然后缓慢分析流量,逐个添加条件。已经很久没有发生过意外的爬虫 DDoS 了。

    大多数爬虫在某种程度上还算诚实。

同日更多故事

2026-08-08