AI 爬虫正吞噬 git.kernel.org 的算力

Creepy Crawlies

AI 爬虫正吞噬 git.kernel.org 的算力

我们原本以为开源数据会被高效利用,没想到 AI 爬虫却选择了最愚蠢的方式:不直接克隆仓库,而是逐个渲染 HTML 页面。这导致我们 20% 的 CPU 算力被浪费在只为训练模型而生的垃圾请求上。从简单的 IP 封禁到引入 Anubis 验证码,我们与爬虫的对抗不断升级。如今,数百万个伪装成普通浏览器的请求来自全球各地的住宅 IP,甚至包括你的智能电视。尽管我们不得不关闭部分功能以自保,但开源数据依然免费,只是获取门槛变高了。

我们花在为爬虫渲染代码提交上的 CPU 周期,比所有其他合法访问(包括 git clone)加起来还要多。
  1. semiquaver

    顺便一提:为什么 shallow clones(浅克隆)是邪恶的?我一直以为它们更便宜,但我想那只是对我的磁盘空间而言吧?(因为服务器必须计算要给你哪些 blobs,而不是直接给“所有东西”?)

同日更多故事

2026-08-30