Perplexity опирается на 215 128 сгенерированных страниц «лучшего ПО»

Three sites made 215,128 "best software" pages for AI. Perplexity cites them

Perplexity опирается на 215 128 сгенерированных страниц «лучшего ПО»

Исследователь задал двум моделям Perplexity вопросы о лучших продуктах в 380 категориях ПО и проанализировал 7 534 ссылки, которые они привели. Почти 60% ссылок ведут на сайты с рейтингом ниже 100 000 по списку Tranco, а 23% — на домены, вообще не входящие в топ-миллион. Три сайта, зарегистрированные после декабря 2023 года и, судя по всему, управляемые одной группой, опубликовали 215 128 машинно-сгенерированных страниц вида «лучшее ПО для...», и эти страницы активно цитируются моделями. При этом сами сайты называют себя «Facts & Grounding Page», что указывает на их ориентацию на поисковые системы, а не на людей.

Эти страницы обращены, в своих заголовках и описаниях, к программному обеспечению, которое их читает.
  1. xpct

    Если я правильно помню, были статьи, предполагавшие, что LLM отдают предпочтение текстам, сгенерированным LLM, перед написанными человеком. Я могу стабильно воспроизвести это, спрашивая Claude, какой фрагмент кода ему нравится больше: тот, что он сгенерировал в другом чате, или тот, что я отрефакторил под свои нужды и считаю более полезным. Он всегда выбирает свой :) Я также замечал, что и Claude, и Codex регулярно включают сгенерированные сайты, когда я прошу их что-то найти. Не помогает и то, что инструменты веб-поиска у OAI и Anthropic крайне ограничены: нельзя исключить ключевые слова или домены.

  2. mstaoru

    Ну, дело не только в этом или в защите от обучения LLM на выходе LLM. Обучение LLM на человеческом выходе тоже проблематично.

    Я путешествовал в один obscure маленький городок, заранее проводя "исследования" с помощью LLM. Каждый из них с энтузиазмом говорил мне пойти на "площадь Foobar" (имя изменено) за "лучшей уличной едой в городе XYZ", некоторые добавляли много красочных деталей.

    Никакой площади Foobar в городе XYZ не было. Никакой площади Foobar не было нигде в мире. Был ОДИН старый комментарий на Reddit, без единого апвоута, к непопулярному посту в непопулярном сабреддите, где кто-то явно сильно исказил название площади и написал что-то вроде "за уличной едой идите на площадь Foobar". Никакого "лучшей" там даже не было.

    Это всё ложь.

  3. Aurornis

    Я воспользовался одним из 12-месячных бесплатных предложений Perplexity, когда они были повсюду. Сначала это казалось немного полезным для простых запросов, где не хотелось вручную просматривать топ-10 результатов Google. Если я искал конкретный рецепт, который помнил, или страницу помощи, или руководство пользователя, он обычно быстро находил это.

    Затем они начали оптимизировать скорость ответов в ущерб качеству результатов. Я могу ввести запрос и увидеть результаты через секунду, но они мусорные. Ссылки и источники, которые он даёт, часто не соответствуют тексту рядом с ними. Похоже, у кого-то был KPI сделать ответы как можно быстрее, и они оптимизировали под это превыше всего.

    Они добавили опцию "Computer", которая должна проводить исследование за вас. В половине случаев я не могу заставить её сработать через интерфейс. Нажатие кнопки отправки не работает. Когда мне удаётся её запустить, большинство таких сессий работают какое-то время, а затем просто останавливаются, прежде чем придёт ответ.

    Единственная причина, по которой я продолжаю им пользоваться, — это наблюдать за компанией, которую активно маркетят и хайпуют и которая должна была бы занимать лидирующие позиции на рынке в чём-то. Даже нетехнические знакомые, слушающие Джо Рогана (где Perplexity, как мне сказали, активно рекламируется), спрашивают меня о нём.

    Теперь появляются сообщения о том, что людей списывают деньги в конце пробного периода без предупреждения, несмотря на их обещания предупредить об этом. Есть тревожно плохие скриншоты службы поддержки, где клиентская поддержка […]

  4. toddmorey

    Я думаю, что у моделей сейчас действительно недостаточно скептицизма к источникам.

    Если посмотреть на трассировки агентов, когда их просят сравнить два варианта, чтобы помочь принять решение, многие страницы сравнения, на которые ссылаются в исследовании, часто размещены одной из сравниваемых компаний; почти все они — сгенерированные ИИ AEO-схемы. Неглубокое рассмотрение мотивов опубликованной информации — это сейчас глюк, которым можно воспользоваться, но окно закроется.

    Уверен, провайдеры моделей создадут какую-то паршивую систему верификации "доверенной" информации о продуктах, сравнений и обзоров за деньги.

  5. jpimbert

    Трудно читать больше нескольких предложений, когда это само по себе явно артефакт Claude.

  6. alangibson

    Perplexity вот-вот узнает, что Google — это компания по борьбе со спамом в первую очередь, а поисковая система во вторую.

  7. rcar1046

    "Общий набор DNS-серверов — это веское косвенное доказательство общего аккаунта Cloudflare, а не доказательство владения"

    — когда читаешь одно такое утверждение, понимаешь, что не стоит верить ни одному другому утверждению в статье....

  8. throwaway2037

    Это гениально. Сингулярность ИИ/LLM наступила, и она имеет форму змеи, пожирающей свой хвост (уроборос) [1] (или пеликана, едущего на велосипеде).

    [1] https://www.newsbiscuit.com/post/ouroboros-unclear-if-it-s-e...

Ещё за этот день

2026-09-02