TheNumbers.com 崩溃:AI 爬虫与预测市场的博弈

What just happened to TheNumbers.com should worry us all

TheNumbers.com 崩溃:AI 爬虫与预测市场的博弈

电影行业权威数据站 TheNumbers.com 在 2026 年 3 月突然宕机,随后以精简版回归。创始人 Bruce Nash 透露,这并非简单的服务器过载,而是 agentic AI 爬虫与预测市场利益驱动下的复杂攻击。随着 AI 自动化流量激增,网站 90% 的请求来自机器,黑客利用 AI 工具挖掘数据漏洞,试图在 Polymarket 等预测市场获得提前获利的优势。这一事件揭示了互联网在大规模 AI 代理面前的脆弱性,以及数据如何被轻易转化为金钱的严峻现实。

黑客攻击现在只需一个廉价的 AI 订阅就能完成,而预测市场让几乎任何数据都能被转化为金钱。
  1. abetusk

    我觉得大家漏掉了文章的一个重点。问题不仅仅是代理程序在疯狂攻击该网站,而是可能存在潜伏的漏洞,允许恶意使用,这正是它先崩溃、随后以数据大幅减少和设计简化的形式恢复的原因。

    文章指出(或推测?)恶意用户试图获取特权访问权限,以便在预测市场投注中占据优势。原文如下:

    > 如果你能比其他人提前看到 The Numbers 的数据,每周如此,你将对所有其他交易者拥有显著优势——比发布稍早一点得知答案,就能让你抢先进行交易。

  2. podgietaru

    "甚至有一个 Reddit 理论认为,这是一次蓄意的‘拉地毯’(rug pull),旨在摧毁免费网站,从而将用户推向付费产品。"

    我知道这并非文章的重点,但我一直在思考这个问题。我想知道我们是否会看到更多资源走向这个方向。

    过去我常发布一些开源小工具。并非因为它们真的有什么突破性(绝对没有),而是因为我遇到了一个问题,心想“嘿,如果别人也有类似问题,能用上我的资源岂不很酷”。

    但现在我真的很不愿意再给免费网络提供更多内容。因为事实是,这些内容会被抓取,扔进一堆训练数据中,稍后又被用来变现,这真的让我很不爽。

    我也能理解,像这样的网站维护者,或者其他免费但极其有用的资源维护者,可能会因此开始感到愤怒。

  3. drumhead

    The Numbers 真是个绝妙的网站,这也解释了为什么它恢复时变成了如此精简的版本。AI 和预测市场让我更讨厌它们了。

  4. baud9600

    我在想的一件事是,我们是否需要一套开源的技术模式和库,来应对这种不断变化的流量构成。

    数百万小型网站和创作者没有能力自行设计防护措施来抵御大规模自动化访问。如果有用的内容现在会招致激进的爬虫流量,许多网站将变得运行成本过高或不可靠。

    答案的一部分是否在于社区响应?也许可以有一个由社区维护的工具包,基于流量数据,供托管网站应用?它可以包括标准的代理识别、速率限制、流量分类、访问策略、缓存、挑战机制、日志记录、归属和使用控制等等。

    实际上,我们需要为当今的自动化流量制定更严格的“交通规则”,以开源技术模式和库的形式提供,而不是让每个网站所有者独自发明这些(他们做不到)。

  5. primitivesuave

    几年前,我运营着一个网站,允许公众查看 COVID-19 疫情期间美国政府向小企业发放的所有补贴。它还追踪了司法部起诉的所有欺诈性贷款,并允许任何人对该公共数据集运行结构化查询。网站上有一个“捐赠”按钮,在整个网站生命周期内收到了约 2000 美元的捐赠,用户可以直接在网站上免费下载整个底层数据集(未压缩约 10 GB)。

    尽管“下载所有数据”链接醒目地放在首页,AI 爬虫还是决定通过遍历搜索端点上的每一个可能维度,下载数 TB 甚至更多的原始 HTML 数据效率更高。即使使用了 CloudFront 缓存结果且后端设置相当高效,每月的账单最终仍有约 1000 美元仅用于网络入口/出口流量,所以我下个月就关闭了该网站。

  6. breve

    AI 公司确实是在社会化成本,私有化利润。

    像 The Numbers 这样的网站必须承担抵御 AI 冲击的生存成本,而 AI 公司却什么也不回馈给他们。

  7. djoldman

    顺便提一下,大公司都允许你通过 robots.txt 阻止爬虫:

    # 阻止 Anthropic (Claude)

    User-agent: ClaudeBot

    Disallow: /

    User-agent: Claude-SearchBot

    Disallow: /

    User-agent: Claude-User

    Disallow: /

    # 阻止 OpenAI (ChatGPT)

    User-agent: GPTBot

    Disallow: /

    User-agent: OAI-SearchBot

    Disallow: /

    # 阻止 Perplexity

    User-agent: PerplexityBot

    Disallow: /

    # 阻止 Google 的 AI 训练

    User-agent: Google-Extended

    Disallow: /

    User-agent: Google-Extended-Factual

    Disallow: /

    # 阻止 Microsoft 的搜索与 AI 爬虫

    User-agent: Bingbot

    Disallow: /

  8. ethagnawl

    冒着过度简化问题的风险,从远处看,这个网站——尤其是其免费、面向公众的部分——似乎非常适合用静态站点生成器/框架进行重写。再加上一个具备机器人感知能力的 CDN,应该能让它在未来多年内以合理的成本保持在线。

    否则,我非常有兴趣了解更多关于他们旧架构和新架构的信息,以及他们开始采用哪些缓解/扩展策略来维持网站在线。

同日更多故事

2026-07-23