Cloudflare 推出 AI 流量新选项
Cloudflare's new AI traffic options for customers

Cloudflare 宣布推出全新的 AI 流量管理功能,不再让用户在“被 AI 训练”和“失去搜索可见性”之间做艰难选择。我们将 AI 流量细分为 Search(搜索)、Agent(智能体)和 Training(训练)三类,允许网站所有者针对每种行为独立设置权限。从 2026 年 9 月 15 日起,新默认策略将在含广告页面自动拦截 Training 和 Agent 流量,同时保留 Search 访问。此外,企业用户可通过 BotBase 获得更透明的机器人目录视图。这一变革旨在打破零和博弈,让内容创作者真正掌握主动权。
如果你运营一个小网站,问题不仅仅是有人可能用你的内容训练模型,而是根本没人能找到你。
HN 评论区
155- simonw
这里的大新闻是,从 9 月 15 日起,Googlebot 将被“阻止训练”策略之一所拦截,因为 Google 使用相同的爬虫基础设施来构建其搜索索引以及训练 Gemini:
> 另一项将于 9 月 15 日生效的变更是,多用途爬虫(特指那些将搜索与训练功能结合的爬虫)将根据其所有行为被允许或拦截,这符合我们呼吁网站所有者保持透明度的立场。由于默认设置将强制执行最严格适用的规则,像 Googlebot、Applebot 和 BingBot 这样的多用途爬虫,将被那些选择阻止“训练”的客户拦截(无论是通过新的 AI 流量管理选项,还是通过旧版的 Block AI bots 服务)。
- jwr
> 对于所有新接入 Cloudflare 的域名,在展示广告的页面上,“训练”和“代理(Agent)”类别默认将被阻止,而“搜索”类别默认仍被允许。
看着 Cloudflare 在这场军备竞赛中左右逢源,真让人精疲力竭。
我实在无法想象,当他们一边做这种事,一边还要用他们的技术去构建代理和 AI 产品时,我还能忍心去用。
> 这也与我们希望培养的激励机制相一致。失去在超过 20% 的托管于 Cloudflare 背后的 Web 域名上的可信状态,是一个具有威慑力的手段。信任变成了一种你可以随身携带、也可以失去的东西。
更甚的是,抛开大语言模型(LLM)的术语不谈,看到他们如此明目张胆地宣称自己的立场仿佛是一件好事,真是既有趣又耐人寻味。
- tekacs
请考虑安装众多工作量证明(PoW)方案中的一种,比如 anubis,而不是使用这些 Cloudflare 的“功能”。我访问 Cloudflare“保护”的网站时,遇到的直接拦截越来越多,而不是任何形式的验证码。每个单独的网站对我来说或许并不特别重要,但看着这个过程这样展开,实在令人沮丧。如果走这条路,你们确实是在选择侵蚀互联网的核心基础。
- fc417fc802
那么,能不能说“除了 Google、OpenAI、Grok、Claude 和 Perplexity 之外的所有爬虫都禁止”?
据我所知,Google 是唯一给我带来访客的。其他大型 AI 玩家未来也可能这样做。
另一个选项是“禁止匿名爬虫”。这样至少,如果某个爬虫想抓取我的网站,它们就必须自我识别。自从 AI 爬虫兴起以来,我受到了严重伤害,大量来自住宅 IP 的请求模仿真实人类,数量惊人。唯一的区别是,它们没给我带来任何收入,只产生了成本。
顺便问一下,Amazon Cloudfront 那边的情况如何?他们提供有帮助的功能吗?这里有谁在用吗?
- timpera
Cloudflare 和整个 Web 的终极目标是什么?我不认为 ADOG(Anthropic、DeepMind、OpenAI、Google)会付费来抓取数据。
什么能迫使它们出手?
更有可能的是,它们会与 Reddit 等主要讨论来源达成未公开的协议。
这并不是说通过获取新信息来提供上下文不会发生,但这并不等同于抓取。