Scraper-Bots anhand ihres Scrollverhaltens erkennen

Detecting scraper bots through scroll behaviour

Scraper-Bots anhand ihres Scrollverhaltens erkennen

Eine Analyse von Scroll-Ereignissen zeigt, dass Menschen und Bots unterschiedliche Muster aufweisen. Der Autor nutzte die Konzepte Burstiness und Memory aus der Komplexitätsforschung und trainierte ein LightGBM-Modell, das mit nur zwei Merkmalen eine Genauigkeit von 73,4 % erreichte. Die Methode eignet sich besonders für Websites mit viel Scrollen, wie Blogs oder Wikipedia, und könnte in Kombination mit anderen Verhaltensdaten einen allgemeinen Schutz bieten.

Ich glaube, dass die meisten Entwickler von Scraper-Bots ihr Scrollverhalten noch nicht verfeinert haben.
  1. xp84

    Ich bin neugierig, ob wir einen Punkt erreichen, an dem einige Websites so bot-freundlich wie möglich sein wollen (hoffentlich wechseln sie einfach zu vernünftigen, ratenbegrenzten öffentlichen APIs, damit alle Zeit und Bandbreite sparen können), während der Rest das Gegenteil will.

    Wenn du einen Dienst anbietest und KI-Agenten wirklich durchstarten, sodass die Leute sagen: "Claude, kauf mir einen neuen Duschschlauch, etwa 1,5 m lang, gebürstetes Nickel. Verwende meine üblichen Bewertungskriterien und gib nicht mehr als 20 $ aus.", dann haben viele E-Commerce-Shops einen sehr, sehr großen Anreiz, bot-freundlich zu sein.

    Und natürlich ist jede "Content"-Site das Gegenteil, will ihre Bandbreite nicht verschwenden und hofft, exklusive kostenpflichtige Content-Deals mit jeder Entität abzuschließen, die sie möglicherweise scrapen möchte.

  2. bryanrasmussen

    Nun, es ist lustig, aber als ich meinen Bot für eine bestimmte Plattform geschrieben habe, habe ich viele dieser Dinge getan, weil ich paranoid war und nicht gesperrt werden wollte. Also habe ich Folgendes getan:

    Alle Elemente in der aktuell geladenen Seite erkennen, mit denen ich etwas tun möchte. Element, auf das ich klicken möchte. Zum Element scrollen, auf das ich klicken möchte. Zufällige Viewport-Scroll-Aktion, leicht über den Viewport hinausgehen, wieder hochscrollen, Mausposition bestimmen, an der ich klicken werde – x, y Mittelpunkt des klickbaren Elements, x, y des Begrenzungsrahmens des klickbaren Elements bestimmen, einen Punkt innerhalb des Begrenzungsrahmens wählen, an dem ich mit etwas Zufälligkeit klicken kann, um zur Mitte zu gelangen, weil Menschen offensichtlich nicht jedes Mal die exakte Mitte treffen, oder? Zufällige Mausbewegungsgeschwindigkeit festlegen. Maus-Ruckeligkeits-Funktion (eine Reihe von x,y-Koordinaten auf dem Weg zum tatsächlichen x,y, das ich anklicken werde, bestimmen; sich diesen nacheinander mit zufälliger Mausgeschwindigkeit nähern, sodass niemand sagen kann: Huh, diese Maus bewegt sich auf unnatürlich direkte und unnatürlich glatte Weise auf den Klickpunkt zu.) Ankommen, wo ich klicken werde. Zufällige Zeit warten, dann klicken.

    Wenn ich auf diese Weise nicht kontinuierlich neue Elemente finde, die ich meinen Kriterien entsprechend anklicken möchte, muss ich jetzt scrollen, um zu sehen, ob ich neue erkennen kann.

    Zufällige Anzahl von Scrollvorgängen. Zufällige Scrollgeschwindigkeit. Zufällige Scroll-Distanz.

    Scrollen starten. Scroll-Distanz erreichen, stoppen. Zufälliges Auf- und Abscrollen.

    Mein Automatisierungsziel war nicht, meinen Bot in die Lage zu versetzen, die Arbeit von Hunderten von Menschen zu erledigen. Es ging darum, die Arbeit zu erledigen […]

  3. ventana

    Das ist großartig!

    Ich habe mit Google-Ads-Traffic auf einer meiner wichtigen Websites experimentiert, und selbst wenn ich nur die Existenz von Mausbewegungs- und Scroll-Ereignissen betrachtete, geschweige denn die Muster, wurde mir klar, wie viele Bots oder Nutzer, die einfach auf die Anzeige (fälschlich) geklickt und nie eine Aktion auf meiner Website ausgeführt haben, in Google Ads als bezahlte Klicks gezählt wurden. Die Analyse von Mustern wie in diesem Artikel wäre sogar noch sinnvoller gewesen.

Mehr von diesem Tag

2026-08-21