Anubis 真的能挡住 AI 吗?
Who does Anubis actually stop?

我在为 Linux 内核编写支持 $ORIGIN 的补丁时,发现 lore.kernel.org 部署了 Anubis 来阻挡 AI 爬虫。讽刺的是,我利用 LLM 迅速开发了 anubis-fetch 工具,轻松绕过其 proof-of-work 挑战。Anubis 本意是阻止 AI,却对拥有强大算力的 AI 几乎无效,反而成了对普通人类的“累退税”。它让使用手机、弱设备或无 JavaScript 浏览器的用户付出额外的时间成本和电量消耗,而爬虫只需一次性解决即可缓存 Cookie 重复使用。这种机制不仅未能有效防御,反而在 AI 时代加剧了数字鸿沟,浪费了全球用户数以千计的人年时间和大量能源。
讽刺的是,Anubis 的目标是阻止 AI,但 AI 却极其轻易地绕过了它,而人类和开放网络仍需为此付出代价。
- jdlshore
嗯,我好像不太同意。作者声称 Anubis 的目的是阻止个人使用 LLM,但我觉得那不是它的初衷。我认为它的目的是减少大规模数据抓取,因为这类行为会给系统带来过大负载。它通过增加抓取成本来实现这一目标,而非完全阻止抓取。
具体来说,恶意行为者会无视 robots.txt 并轮换 IP 地址,使得封禁变得困难。Anubis 的作用是让建立新连接的成本更高,从而促使人们复用现有的连接/cookie,然后再回退到常规的阻止恶意行为者的手段。
(没错,大规模抓取确实是 AI 训练公司的产物,但问题在于大规模抓取本身,而不在于 LLM。)
- novafunc
Anubis 的主要目标是防止网络爬虫对网站发起 DDoS 攻击。它并不是要设计成不可逾越的挑战,也不像 Google 那些侵犯隐私的验证码那样只允许人类访问。
你完成工作量证明,就能获取内容。并非所有网络爬虫都愿意付出这份代价,这也就减轻了对 Web 服务器的压力。
这绝非一个完美的系统。其设计目标本身就限制了它做到完美。它力求不要对人类用户造成过多困扰,不要误伤真实用户,也不要侵犯隐私。
- yellow_lead
> The exact adversary Anubis targets defeats it trivially.
说错了,Anubis 通过要求工作量证明来阻止网页的大规模爬取,这使得访问这些网站变得成本更高。
Anubis 并非为了阻止使用 LLM 的单个用户而构建的。
- nitwit005
这搞错了目标。它不是为了封禁爬虫,而是为了遏制过度(且昂贵)的抓取行为。
Anubis 的 cookie 是绑定到特定 IP 地址的。爬虫通常使用大量 IP 地址,因此它们付出的成本将远高于此处的暗示。
- throw0101d
我对这个名字感到好奇:
> Anubis 是一个 Web AI 防火墙工具,它通过一个或多个挑战来“称量”你连接的灵魂[1],以保护上游资源免受爬虫机器人的侵害。
* https://anubis.techaro.lol/docs/
> “称心”仪式发生在杜阿特(冥界),在那里死者由阿努比斯审判,他使用一根羽毛,代表真理与正义女神玛阿特(Ma'at),她负责维持宇宙秩序。心脏是生命之灵(ka)的居所。比玛阿特羽毛重的心脏会被拒绝,并被吞魂者阿米特(Ammit)吞噬。
* https://en.wikipedia.org/wiki/Weighing_of_souls#Ancient_Egyp...