Perplexity 引用的 21 万 AI 推荐页真相
Three sites made 215,128 "best software" pages for AI. Perplexity cites them

我们测试了 Perplexity 在 380 个软件类别中的推荐来源,发现近六成引用指向排名极低的网站。更令人惊讶的是,三个看似独立的网站竟由同一方控制,它们批量生成了 215,128 个“最佳软件”页面,专门用于被 AI 检索系统抓取。这些网站的页面标题甚至直接写着“事实与 Grounding 页”,显然是为机器而非人类读者设计的。当 AI 依赖这些机器生成的内容作为决策依据时,我们看到的推荐结果可能只是精心设计的营销闭环,而非真实的市场共识。
这些页面在其标题和描述中,是写给读取它们的软件看的,而不是写给人类读者看的。
HN 评论区
124- xpct
如果我没记错的话,有些论文曾指出,大语言模型(LLM)往往更偏爱由 LLM 生成的段落,而非人类撰写的。我可以稳定地复现这一现象:只要问 Claude 它更喜欢哪段代码——是它在另一个对话中生成的,还是我为了自己的需求重构后觉得更有用的——它总是选自己生成的 :) 我也遇到过这种情况,当我让 Claude 和 Codex 搜索某些东西时,它们经常把生成的网站也包含在结果里。而且,OAI 和 Anthropic 的网页搜索工具限制极多,帮不了什么忙:既不能排除关键词,也不能排除特定域名。
- mstaoru
好吧,问题不只是这个,也不仅仅是防止 LLM 在 LLM 生成的输出上进行训练。LLM 在人类输出上进行训练同样存在问题。
我之前要去一个偏僻的小镇旅行,出发前用 LLM 做了一些“调研”。每一个模型都热情地告诉我,去“Foobar 广场”(化名)能吃到
- Aurornis
XYZ 镇最好吃的街头小吃”,有些还加了很多生动的细节。
但 XYZ 镇根本没有 Foobar 广场。事实上,全世界都没有 Foobar 广场。唯一的来源是 Reddit 上一个冷门子版块里一个不受欢迎的帖子下的一条旧评论,没人点赞,里面有人明显把广场的名字拼错了,只说了句类似“想吃街头小吃就去 Foobar 广场”的话,压根没提“最好吃”这种词。
全是谎言。
- toddmorey
当 Perplexity 到处推广时,我用过他们提供的 12 个月免费试用。起初觉得有点用,尤其是一些简单查询,我不想手动翻前 10 个 Google 结果的时候。如果我在找某个记得的食谱、帮助页面或用户手册,它通常能很快找到。
后来他们开始优化响应速度而非结果质量。我输入一个查询,结果一秒钟就出来了,但全是垃圾。它给出的链接和参考文献经常和旁边的文字对不上。感觉就像有人被定了个 KPI,要求尽可能快地给出回复,于是他们把所有精力都优化到了这一点上。
他们加了一个“Computer”选项,号称能帮你做调研。一半时候我根本没法通过 UI 触发它。按提交按钮没反应。就算能触发,大多数会话运行一会儿后就突然停止,再也回不来答案了。
我还在用它的唯一原因,是想继续观察这家被大力营销和炒作、本该在某个领域占据市场领先地位的公司。甚至我认识的非技术人员,那些听 Joe Rogan 播客的人(据说 Perplexity 在那上面投了大量广告),都在问我关于它的事。
现在有报道说,用户在试用期结束时被悄悄扣费,尽管他们声称会提前警告。还有一些令人震惊的糟糕客服截图,显示客服支支吾吾……
- jpimbert
我认为目前的模型缺乏足够的来源怀疑精神。
如果你查看代理(agent)在比较两个选项以辅助决策时的执行轨迹,会发现研究中引用的许多比较页面,往往由被比较的公司之一托管;几乎全是 AI 生成的 AEO(AI 引擎优化)套路。目前,不深入考量发布信息的动机是一个可被利用的漏洞,但这个窗口期即将关闭。
我敢肯定,模型提供商会建立一套糟糕的付费验证系统,用于所谓的“可信”产品信息、对比和评论。
- alangibson
当这篇文章本身显然就是 Claude 生成的产物时,很难让人读下去超过几句话。
- sph
Perplexity 即将明白,Google 首先是一家反垃圾公司,其次才是搜索引擎。
- rcar1046
LLM 搜索引擎有什么机制来防止它们使用其他 LLM 生成的内容进行训练?
我们会不会走到这样一个地步:AI 生成的网站占据互联网的大多数,而 LLM 又在它们自己的重复输出上进行训练,导致所有的谎言和缺陷被指数级放大?
或者,2022 年之前的语料库所代表的人类知识会被视为低背景噪声的钢铁标准,而之后的内容除非经过认证,确认是由人类心智创作且未受幻觉污染,否则将越来越不可靠?