Reddit 宣称纯 HTML 不安全
So Reddit has decided that plain HTML is unsafe

Reddit 最近以安全为由,要求用户必须登录才能访问 old.reddit.com。作者指出,这实际上是针对爬虫的防御策略,因为旧版界面基于纯 HTML,内容容易被抓取。相比之下,新版 Reddit 依赖大量 JavaScript,加载更慢且资源消耗更大,却声称更安全。作者认为,这不过是 Reddit 为了垄断其用户生成的数据,在 LLM 时代将其视为金矿,而牺牲了部分老用户的体验。所谓的“安全”理由,更像是一场为了阻碍数据爬取而精心策划的公关话术。
毕竟,单纯地培育社区对于新科技来说,目标还不够高尚。
HN 评论区
617- benjiro29
我不买账那种所谓的“反爬虫”保护,毕竟给任何 Reddit 链接加上 .json 后缀照样能拿到数据。
示例:https://www.reddit.com/r/whatisit/comments/1v3mzl6/what_is_t...
- felooboolooomba
我觉得到了这个地步,我差不多可以放弃 Reddit 了,我的大部分问题现在都能由 LLM 解答。
而且 Reddit 上的讨论质量简直糟糕透顶,里面全是机器人。
- tdeck
实际上,纯 HTML 才是安全的。
正是 JavaScript 让那些商业利益方能够弹出窗口、烦扰用户,并操控你的网页浏览体验以迎合他们的需求。
我的浏览器里装了一个应用,可以让我随时关闭 JavaScript,从而消灭绝大多数弹窗和烦人的提示。
- galleywest200
作为一个曾经为自己的小项目做过大量爬虫的人,我就直说了吧:Reddit 所谓的“安全担忧”不过是公关话术,真实意图是“我们不想继续维护 old.reddit 了”。
诚然,你无法像用纯 HTML 爬虫那样轻易地抓取新 Reddit,因为纯 HTML 爬虫运行成本更低。虽然新 Reddit 的 JS 确实通过需要运行无头浏览器(headless browser)来“拖慢”爬虫速度,但这真的能大幅减缓爬虫吗?
并没有。因为你完全可以启动更多实例并路由到更多代理。考虑到你甚至可以在单核 CPU 的廉价节点上每天抓取数百万页……
限制网站爬虫的关键因素根本不是 HTML 与 JS 的对比,也不是客户端与无头浏览器的区别。真正的瓶颈在于:通过切换不同 IP 来规避检测、伪造浏览器信息、伪装流量以避免露出自动化的痕迹(以及规避 TLS 指纹识别)。
在 AI 辅助编程出现之前,我写过这类东西,几天就能搞定。现在有了触手可及的 LLM,几个小时你就能得到一个内置伪装功能的完整可用版本。
至于文件体积差异变大这点也无所谓,你可以通过伪造缓存响应来屏蔽无关文件,让服务器以为你是回头客,从而无需向浏览器实例灌入图片、字体等资源。有些人把这当成一种防御手段,也就是通过增加带宽消耗来限制你,哈哈。
所以在我看来,这根本不是关于对付爬虫的问题,而是试图把用户推向新 Reddit,以便他们最终能……
- aucisson_masque
Meta 花了 20 亿美元在验证游说上。看起来非常成功。
再过一两年,你可能不扫描身体部位、不提供屁股的身份证号就无法浏览互联网了。
https://www.gadgetreview.com/reddit-user-uncovers-who-is-beh...
- account42
Reddit 对我来说已经死了好几年了。
现在……死得更彻底了。
我几天前就自己注意到了这个变化,当时就怀疑有些不对劲。
(我偶尔会上去找些其他地方不容易找到的信息。只有为了抓取我现在已设为私有的子版块内容时才会登录,大概一年几次吧。)
- khurs
我最近偶然发现,点进某个链接时他们把我登出了。我不觉得这次改动会让我重新登录。这个网站的价值已经崩盘,现在唯一的问题是,哪个网站能接棒成为下一个主流链接/图片讨论平台。
> 这是因为在搜索查询中加上 site:reddit.com 基本上就是找到真人撰写内容的必杀技。
这已经有一段时间不成立了。如今你在 Reddit 上找到的很多东西感觉极其虚假。这就像应该有一个古德哈特定律的变体:一旦某个论坛以“真人撰写内容”而闻名,它就不再是真人撰写内容的论坛了。
- msny
Reddit 与 OpenAI 和 Google 签有许可协议,所以他们很可能是在试图把其他 AI 公司挡在门外。
https://mediaandthemachine.substack.com/p/reddits-new-ai-lic...