AI 爬虫肆虐,开放网络危在旦夕

An Update on the scraper situation

自 2025 年我们讨论 AI 爬虫问题以来,情况不仅没有好转,反而愈演愈烈。如今,数以百万计的 Residential proxies 正被恶意利用,这些流量往往来自被植入恶意软件的普通设备或看似合法的 Bright Data 等公司提供的“免费”VPN。这些网络不仅疯狂抓取网页数据,更让网站运营者疲于奔命,不得不部署 Anubis 等验证机制或设置登录门槛。虽然 Google 曾打击过 IPIDEA 僵尸网络,但新的威胁如媒体流媒体设备上的 Popa 僵尸网络又接踵而至。在这场针对训练数据的军备竞赛中,无论是政府机构还是犯罪组织都在暗中布局,而整个互联网正沦为这场冲突的牺牲品。

互联网整体正陷入这场军备竞赛的交火之中。
  • 有评论者指出,真正的威胁并非来自 AI 公司本身,而是其创造的盈利需求驱使无数个体利用'vibe coded'的脚本,通过 SDK 将数百万台普通设备(如计算器、手电筒 App)接入分布式网络进行隐蔽爬取。
  • 关于 Proof of Work 的争议在于,反对者认为攻击者可利用被劫持的 IoT 设备或 Headless Chrome 自动解题,成本由受害者承担;支持者则提出可将 PoW 与加密货币挖矿结合,让网站通过算力消耗直接获利以覆盖服务成本。
  • 亲历者提到,滥用 Residential Proxies 的恶意爬虫使得基于 IP 的封锁失效,因为阻断这些 IP 会误伤大量合法用户,而数据中心 IP 因长期被滥用已普遍被视为不可信。
  • 针对 Cloudflare 等防护方案,有用户反馈其验证延迟(5 秒以上)远高于 Anubis(1-2 秒),且常错误拦截可缓存的营销页面,质疑其在拥有海量 IP 数据下的优化能力。
  • 有开发者分享了一种基于防火墙日志的防御策略:将扫描非服务端口的 IP 视为恶意并长期封禁,认为这种'投掷鸡蛋者不得进门'的机制虽难以规模化,但对个人服务有效。

同日更多故事

2026-07-10