99% 的网站流量竟全是 Bots

99% of My Website Traffic Is Bots

99% 的网站流量竟全是 Bots

我原本以为自己的网站流量增长是运营得当的结果,直到深入分析数据才发现,99% 的访问者并非真实人类,而是各种 Bots。这些自动程序不仅消耗了大量服务器资源,还严重扭曲了数据分析结果。面对这一现状,我不得不重新审视网站的安全策略,思考如何有效区分真实用户与恶意爬虫。在 JavaScript 和 cookies 成为必要验证手段的今天,如何在保障用户体验的同时抵御 Bots 的侵袭,已成为每个网站运营者必须面对的难题。

当我深入分析数据时,才发现 99% 的流量其实都来自 Bots,而非真实用户。
  1. jwr

    这里令人担忧的一点是,太多人将“谁可以访问我的网站”这一决定权外包给了大公司(Cloudflare)。如果该公司决定某个用户不应看到该网站,那么该用户就看不到,而且没人会知道此事,用户也毫无申诉渠道。这并非我所期望的开放网络。

    对机器人爬取网站采取过激反应的第二个副作用是:如果你试图对抗所有机器人,最终也会伤害到那些使用“机器人”的真实用户。如果我运行一个本地脚本或 LLM,需要从你的网站获取网页,而你将该脚本或 LLM 识别为机器人并加以阻止,那你就伤害了我这个用户。我想要这些信息,却无法获取,除非我投入自己的时间和精力去访问你的网站。这或许并非你预期的结果,但值得考虑。

    最后,值得一提的是,有很多网站的所有者都在抱怨机器人,但真正的问题在于这些网站本身构建糟糕,无论如何都应该改进。机器人流量未必是坏事。

  2. johnorourke

    Anubis[1] 是那些未使用 Cloudflare/Fastly/Bunny 等服务的网站的绝佳解决方案。我们曾在一个面向全球所有国家的网站上遭遇数百万次机器人请求,因此无法按国家屏蔽;同时由于对方使用伪造的 user-agent,也无法据此屏蔽。Anubis 利用“工作量证明”(proof of work)来检测真实的浏览器软件。

    [1] https://anubis.techaro.lol/

  3. tarr11

    > 我运营整个网站的正常账单约为每月 90 美元。在某个流量激增的糟糕月份,费用暴涨了约 500%。

    这是 D1 的问题——其成本令人惊讶。你可能应该放弃 D1,转而使用静态网站。你的网站完全没有理由花费这么多钱。

  4. GodelNumbering

    我刚检查了 Cloudflare 上 SignalBloom(https://www.signalbloom.ai,我拥有并运营)的数据。

    在过去 72 小时内,仅 Claude-searchbot [1] 就抓取了约 205,000 个页面,却只发送了 1 次引荐流量。网站上有很多免费的金融数据,我希望能让真实用户从中受益。很难不感到有点被坑了:Claude 可以向它的用户宣称“找到了!”,而我却得不到任何积分或补偿。

    [1] 确切 user agent 为 `Claude-SearchBot/1.0; [email protected])`

    证据:https://i.postimg.cc/Pqc3SS8T/Screenshot-2026-08-07-at-5-33-...

  5. qbane

    > 是的,我的网站数据正是通过抓取那些公开文档获得的。所以我是一个爬虫,却在写一篇抱怨爬虫的博文。我知道这听起来有多讽刺。

  6. varenc

    有人能帮我理解这背后的根本动机吗?

    像 Google 这样的爬虫想要索引整个互联网,这说得通。但同一个爬虫在一小时前刚抓取过某个页面,为什么要再次抓取?或者,所有这些流量只是独立的实体,各自试图缓存互联网?考虑到机器人流量的规模,这似乎不太可能。

    同一个实体在不到一小时前刚抓取过某个页面,为什么要再次抓取?背后的动机是什么?

  7. thomashabets2

    这篇文章中明显缺失的一点是:没有讨论其中一些是否实际上是人类访客,只是人类通过 ChatGPT 或类似工具发起查询,而不是直接访问。

    如果这是响应人类提出的关于慈善机构的汇总信息请求,从而触发网络搜索并点击结果链接以获取详细信息,这真的算是机器人吗?好吧,显然算,但这与文章暗示的“他们的爬虫没有任何限流”[1] 是完全不同的概念。

    > 挑战 46 个数据中心 ASN。人类不会从 AWS 浏览。

    拥有云端工作站的人确实会。

    > 机器人消耗了 99% 的账单,而我承担了 100% 的费用。

    以这种方式运营网站始终面临钱包 DDoS 攻击的风险。

    [1] 不过是的,绝大多数确实是纯自动化操作,中间没有人类参与。这是我的假设,但感觉是个合理的假设。

  8. ddxv

    我也处于类似境地。大概 99.999% 都是机器人。根据 Cloudflare 的数据,我有近 100 万“独立访客”,而我的真实用户每天只有几十人。尽管如此,我热爱开放的互联网,并努力尽可能保持开放。

  9. mgbmtl

    我在服务器上每小时运行脚本,检查访问量前 25 的 IP(按 /24 聚合)。如果这些前 25 的 IP 中有来自中国、越南等国家的,或者来自 Alibaba/Amazon 等云服务商的,就会通过 iptables 屏蔽整个 /24 网段。

    这远非完美,但这是一种快速清除机器人同时不完全屏蔽来自越南等国家用户的方法。

    然而,在我管理的一个 Gitlab 实例(500 名用户)上,我们必须限制查看 git 日志以及除 issue 之外的几乎所有内容。机器人太激进了。中国爬虫拥有巨大的 IP 范围,它们通常每天只发送 10-20 次请求,但每天总共会产生超过 5 万次请求。在那之后,我们的服务器负载从 99% 降到了 0.1%(而且这是一台相当大的服务器)。

  10. andai

    > 这里确实存在冲突。我希望 Google、Bing 和 DuckDuckGo 抓取我的网站并为我带来新读者。但我不想让其他人把这里洗劫一空。

    听起来我们似乎缺少一个点对点网络。

    与其一遍又一遍地下载相同的数据,我们只需下载一次然后共享。

    这对所有参与者来说不是更好吗?

    它还可以作为一个分布式的 WayBack Machine,以防 Internet Archive 发生任何意外。(除了机器人末日之外,我认为这非常迫切地需要。)

同日更多故事

2026-08-07