AI 机器人伪装成 ClaudeBot 扫描漏洞
Someone is running mass vulnerability scans, spoofing AI bots like ClaudeBot

Known Agents 的最新数据显示,AI 相关机器人流量占比已升至 28%,但其中混杂着大量伪装成 ClaudeBot 等知名 AI 助手的恶意扫描程序。这些攻击者利用 AI 代理的掩护进行大规模漏洞探测,而 98.5% 的机器人仍会遵守 robots.txt 规则。报告详细拆解了 AI Data Scraper、AI Search Crawler 等不同类型的代理行为,揭示了从 ChatGPT-User 到 ClaudeBot 的流量分布真相。网站运营者需警惕那些打着 AI 训练旗号、实则进行安全扫描的“李鬼”机器人。
有人正在运行大规模漏洞扫描,并伪装成像 ClaudeBot 这样的 AI 机器人。
HN 评论区
224- yabones
任何开放了 80 或 443 端口的服务器,每天都会被成千上万个随机 IP 扫描,它们都在寻找 WordPress 登录页面。唯一的新花样是,它们现在伪装成了另一种恼人的机器人类型。虽然多了一层 sophistication(复杂化)和 subterfuge(欺骗手段),但这本质上还是我们一直要对付的那堆垃圾流量。
- binaryturtle
平均每分钟大约有 100 个(TCP)请求打到我的家用路由器,进行各种探测和扫描。很明显,其中很多都在检查 telnet 端口。有时你会看到一大群完全不同的 IP 在扫描整个端口范围(逐个端口探测)。
你会看到很多 deepfield、censys-scanner、visionheight.com、shadowserver.io 之类的,当然也有那些惯犯的中国或俄罗斯 IP。
在使用 OpenWRT 时,我会用类似这样的命令:`tcpdump -i pppoe-wan 'inbound and tcp[tcpflags] & (tcp-syn|tcp-ack) == tcp-syn'`,或者如果我们在运行某些 torrent 客户端(比如这里在 44000 端口),为了避免干扰结果,可以用:`tcpdump -i pppoe-wan 'inbound and tcp[tcpflags] & (tcp-syn|tcp-ack) == tcp-syn and not port 44000'`。我不确定这是不是处理这种情况的最佳方式,但这绝对能让你看清路由器上到底拦截了什么。
- Bender
列表中列出的很多 user-agent 经常是伪造的。去查一下这些 IP 所属的 ASN。如果我屏蔽掉大多数 VPS 提供商,大部分伪造的机器人就会消失。不过仍有一些是从家庭网络或手机上运行的,它们使用了被劫持的代码(那些所谓的阅读器其实不仅仅是阅读器,而是多功能代理)。说到这个,不要相信链接里的源代码,而是应该反编译你手机上正在运行的实时代码,然后让 AI 去分析它。
- nate-gehringer
我最近写了一篇博客,介绍了一些我开发的用于对抗此类流量的 Cloudflare Workers:https://code.backwater.systems/blog/#2026-06-29T23:40:00.000...
- Tharre
既然 AI 机器人本来就被拦截的概率就高得多,为什么还要自愿伪装成 AI 机器人呢?这看起来完全是徒劳的。
我能想到的最佳假设是,他们想以此让 AI 公司看起来更糟糕,但那些公司自己通过每小时反复抓取每个人几百次的行为,已经做得非常出色了。
- ChillyCapy
伪造的 Googlebot 访问是我正在处理的网站日志中排名第一的。起初,我试图用 Cloudflare 的 ASN 屏蔽规则或他们的托管 Bot Fight 模式来对抗它们,但结果发现这不仅毫无意义,反而对我的网站有害。
Bot Fight 模式开始随机拦截真实的 Bing、Google 和 OpenAI 爬虫,这浪费了爬虫预算,也让爬虫不愿再来回访更新过的页面。
有时候,不主动与机器人对抗,而是加固环境,只针对最恶劣的违规者做出反应,才是更好的选择。
- kevin_nisbet
万一有作者在看 HN,我想说这个页面有个相当疯狂的渲染 bug:一大部分内容在上下跳动几个像素。我调整了几次宽度后好像消失了,但我没太深究。可能第一次渲染时我的页面宽度太小了。不过这真的非常分心,文字乱动让人很难阅读。我用的是最新版 Chrome,刷新页面多次都出现了这个问题。但我没再深入调查。
- blobbers
一个有趣的想法:也许“开放互联网”的概念已经结束了。
也许我们现在正进入一个严格实行 KYC(了解你的客户)的世界。就像