94.8% 的网站在 AI 回答中彻底消失
Only 8.9% of sites block AI crawlers, but 94.8% are never cited in AI answers

AI Visibility Index 最新数据显示,尽管只有 8.9% 的网站在 robots.txt 中明确阻止了 AI 爬虫,但高达 94.8% 的受访网站从未出现在 AI 助手的回答中。在针对 193 个网站的 5978 次查询中,仅有 10 个网站被提及。Gemini 以 2.9% 的提及率领先,远超 ChatGPT 和 Claude。数据揭示了一个关键矛盾:大多数网站错误地只屏蔽用于训练模型的 GPTBot,却忽略了屏蔽用于实时检索的 OAI-SearchBot,导致自身在用户提问时“隐形”。此外,仅有 19.3% 的网站发布了 LocalBusiness 结构化数据,使得机器难以识别其身份。
一个屏蔽了整个爬虫组的网站,付出的代价就是失去被引用的机会。
HN 评论区
61- brookst
这抱怨挺奇怪的。
假设我问“谁创建了 Linux?”,Claude 正确地告诉我 Linus Torvalds,并链接到 Wikipedia。
可能还有成千上万,甚至数十万个其他网站也包含这条信息。难道 LLM 必须链接到每一个网站吗?
大多数网站根本没有任何独特信息,即使有独特信息的网站,也很少只包含独特信息。暗示大多数网站因为被爬取了就值得被链接,这似乎是一种统计谬误。你可以用同样的逻辑来说 Google 爬取网站的比例与它们出现在搜索结果首页的比例。
- eterm
我们现在是在抱怨没有被爬取吗?
这看起来像是新一代的“SEO”,把自己标榜为一种能进入 AI 结果的服务?
这不是我想参与的未来。
也许在摆脱一切由金钱驱动之后,LLM 注定会被人们花费 $X 进入 AI 以赚取 $X+1 所毁掉,导致 X 不断攀升的军备竞赛,最终损害用户利益。
- mark_l_watson
我的测试结果有点奇怪。上个月我测试了五个 AI 聊天网站,关闭了网络搜索功能,其中四个都有关于我个人的零星信息(我写什么书、用什么技术,以及一些其他随机信息)。那个链接给我的网站得了零分,因为它测试的是 AI 模型是否会在商业或销售查询中推荐我的网站。
- alsetmusic
这很合理。少数几个网站因为体量巨大而掌握了大多数“可信”信息。我不指望你会引用我那只有三篇帖子的博客。真正的难点在于让 AI 公司停止轰炸那些不会出现在答案中的网站,但即使它们没有将某个网站用作答案来源,爬取本身仍然提供了价值。
- josh-wrale
这让我好奇,付费的 Medium 和付费新闻是否被用作 AI 训练的输入。肯定是的。