KI-Crawler legen git.kernel.org lahm: 20 % der Rechenleistung für Scraper

Creepy Crawlies

KI-Crawler legen git.kernel.org lahm: 20 % der Rechenleistung für Scraper

Der Betreiber von git.kernel.org zeigt mit harten Zahlen, wie sehr KI-Crawler die Infrastruktur belasten: 14 von 90 CPU-Kernen rendern ständig Commits für Bots, die Daten für LLMs sammeln. Trotz Proof-of-Work-Schutz (Anubis) lösen inzwischen 33 % der Anfragen die Challenge. Legitime Nutzer machen nur noch 2 % des Traffics aus. Der Artikel analysiert das Problem und kündigt an, Funktionen einzuschränken, um die Last zu reduzieren.

Im Durchschnitt sind das 20 % unserer gesamten Kapazität – außer dass die Schwärme in Wellen herabsteigen und die tatsächliche Grafik viel zackiger ist als eine flache 20-%-Linie.
  1. semiquaver

    > denn offenbar ist das, was wir zu bieten haben, es wert, eine Menge Rechenzyklen zu verschwenden, um die Anubis-Herausforderung zu berechnen.

    Diese Aussage enthält das grundlegende Missverständnis hinter Anubis. Es sind nicht viele Zyklen. Es gibt keine Schwierigkeitsstufe, die für Bots unpraktisch, aber für Menschen auf mobilen Geräten nutzbar wäre.

    Ich habe neulich bemerkt, dass lists.ffmpeg.org auf Anubis-Schwierigkeitsstufe 6 umgestellt wurde, was etwa 180 Sekunden für mein iPhone 17 dauert, um es mit ~100 KH/s zu lösen, was die Seite unbenutzbar macht. Also habe ich etwa 10 Minuten damit verbracht, eine Safari-Erweiterung zu coden, die eine native Brücke zu einem optimierten C-Kernel mit ARM-SHA256H*-Befehlen hat, die auf demselben Gerät über 200 MH/s schafft. Das löst die Anubis-Schwierigkeitsstufe 6 in ein paar Millisekunden.

    Angesichts der Zahlen und Fähigkeiten (ein einzelner $5K-ASIC-Miner erzeugt 200 TH/s, eine Million Mal mehr Hashrate als mein optimierter Kernel auf einem iPhone) sehe ich nicht, wie Proof-of-Work eine nachhaltige Strategie sein kann, um Bots fernzuhalten, ohne die Benutzererfahrung für Menschen zu ruinieren. Es ist ein Wettrüsten, das nicht zu gewinnen ist.

    Bearbeitung: Ich ermutige dich, es selbst zu versuchen. Hier ist ein Beispiel-Prompt, der die Aufgabe in einem Durchgang lösen sollte:

    > Erstelle eine iOS-Safari-Web-Erweiterung, die den Anubis-Proof-of-Work mit einem nativen C-ARM64-SHA-256-Kernel beschleunigt. Berechne das invariante 128-Byte-Herausforderungspräfix vor, suche nach dezimalen Nonces mit fester Breite mit ARM-SHA-2-Intrinsics und zwei Worker-Threads und ziele auf Lösungen der Schwierigkeitsstufe 6 in unter einer Sekunde. Übermittle Herausforderungen von einem Safari-Content-Script über [...]

  2. robotmay

    Ich habe die letzten Tage damit verbracht, Fallen auf einer meiner Websites zu installieren, ironischerweise natürlich mit LLMs, und es hat mir ziemlich viel Spaß gemacht.

    Statt des Proof-of-Work-Systems von Anubis bin ich den iocaine-Weg gegangen, habe es aber in meiner Anwendung selbst implementiert, da sie in Elixir geschrieben ist und es wirklich Spaß macht, Scrapern Probleme zu bereiten, wenn es fast keine Serverressourcen kostet.

    Derzeit trickse ich böse Scraper in einen falschen unendlichen Black-Hole-Pfad mit der Verheißung von leckeren Daten, dann serviere ich ihnen Bilder ein Byte pro Mal über 15 Minuten (nachdem ich den Header schnell gesendet habe), blähe die Antworten auf, um ihnen Tokens zu kosten, und gebe zufällig KI-generierte Bilder von sexy Toastern zurück. Ich habe ein Admin-Dashboard mit einer kleinen Bestenliste, welche am meisten gestopft werden, und das hält mein Herz an diesen feuchten Herbstabenden warm.

  3. virgoerns

    Ich betreibe auch eine öffentliche cgit-Instanz und habe über 1 Million Hits pro Tag, obwohl meine Hobbyprojekte bei weitem nicht die Größe oder Wirkung des Kernels haben. Ich musste (über die nginx-Konfiguration) die cgit-Endpunkte für Diffs, Blame, Snapshots und historische Commits blockieren, weil nichts anderes funktioniert. Jetzt geben sie 402 (Zahlung erforderlich) zurück. Ich betrachte das als meine totale Niederlage und es bringt mich innerlich um, aber es ist, wie es ist.

  4. tptacek

    Tavis Ormandy hat das, über Anubis, vor fast genau einem Jahr vorhergesagt:

    https://news.ycombinator.com/item?id=44962529

    Es hat sich nie wirklich als Lösung herauskristallisiert. Leistungsstarke Scraper sind besser gerüstet, um Proof-of-Work-Herausforderungen zu bewältigen als Endbenutzer. Proof-of-Work ergibt Sinn für einen Passwort-Hash, wo jeder einzelne Versuch eines Passworts keinen marginalen Nutzen bietet. Aber jede Anfrage von einem Scraper ist für den Scraper produktiv.

  5. jdnier

    Ich habe den Schreibstil in diesem Artikel wirklich genossen.

    Und die Bot-Progression von "User-Agent ändern" über "IP-Adressen wechseln" bis hin zu Anbietern, die ganze Subnetze, ganze ASNs sperren müssen, und die Erkenntnis, dass "Proxy-SDK-Monetarisierung" eine Sache ist, spiegelt die Bedrohungsakteur-Progression aus der Zeit vor LLMs wider.

  6. Demiurge

    Ich betreibe eine ehemals beliebte Gaming-Website, die früher Hunderte legitime Anfragen pro Sekunde hatte. Die Last war besonders hoch während beliebter Event-Zeiten. Deshalb läuft sie schon immer auf einem dedizierten Server.

    Sie hat auch einen "Online-Benutzer"-Zähler, der versuchte, echte Benutzersitzungen von nicht authentifizierten Benutzern zu zählen, die immer noch eine Sitzung hatten, die es ihnen erlaubte, zu kommentieren oder bestimmte Filter- und Anzeigeoptionen zu ändern. Er hat den Google-Bot nie gezählt.

    In den letzten Jahren stieg dieser Zähler von 100-200 Benutzern online auf Tausende. Ich habe mich viele Jahre lang kaum darum gekümmert und nur kleinere Upgrades und Backups gemacht. Allerdings ist die Website auch ziemlich langsam geworden, diese Sitzungen hatten offensichtlich Auswirkungen. Also habe ich schließlich diese Crawler untersucht, und ja, es stellt sich heraus, dass es eine wahnsinnige Menge an Verkehr ist, der völlig künstlich ist, die Website hat nur eine Handvoll echter Benutzer und Tausende dieser Crawling-Sitzungen, die tatsächlich versuchen, alles zu tun, was sie können, jeden Button zu klicken. Es hilft nicht, dass Sortieren und Suchen mit GET-Links implementiert wurden.

    Ich habe den Zähler repariert, um die Crawler auszuschließen, aber ich habe ein kleines Dilemma. Ich will die Bots nicht davon abhalten, ihr Wissen über all die Inhalte zu aktualisieren.

    Die beste Lösung, die ich finden konnte, ist die neue CloudFlare-Funktion, bei der sie den Crawlern möglicherweise für jede Anfrage etwas berechnen oder sie anderweitig blockieren. Ich denke, das ist eine fantastische Idee für das Internet im Allgemeinen. Ich habe mich für den Beta-Zugang angemeldet, aber noch nichts von ihnen gehört [...]

  7. mzajc

    > Warum ist git.kernel.org für Crawler "interessant"

    Ich denke, der Beitrag unterschätzt, wie wenig Gedanken und Mühe in diese Bots gesteckt wird. Ich betreibe auch eine cgit-Instanz mit weitaus weniger interessanten Projekten und bin nicht von der Flut an HTTP-Anfragen verschont.

    Die Erklärung, auf die ich kommen konnte, ist, dass sie versuchen, alle Links zu crawlen, egal wie viel Sinn es macht oder wie viel Last es verursacht. Da cgit cgit ist, bedeutet das Milliarden von Links für alle Kombinationen von Parametern und Hashes. Oder es ist ein absichtlicher DDoS-Angriff.

  8. Waterluvian

    > Es war sofort äußerst effektiv – die Bots gaben einfach auf. Für ein paar Monate war es paradiesisch: Bots wurden an der Peripherie blockiert und gaben auf, zogen zu leichteren Zielen weiter; die Benutzer waren leicht genervt, tolerierten es aber, und der Anubis-Stack war überall einfach zu deployen.

    Als Techniker, der mit Technikern arbeitet, bin ich extrem sensibel für diese Art von Voreingenommenheit geworden. Ist diese Lösung tatsächlich besser? Ist der CPU-Aufwand tatsächlich schlimmer als alle leicht zu nerven, oder ist es ein Problem, das gelöst wird, weil es "die Sinne beleidigt"?

    Ich neige weder zu Ja noch zu Nein für diesen Fall. Aber ich sehe regelmäßig Leute, die voreilige Schlüsse ziehen, ohne zu messen. Was kostet die 20% und ist dieser Preis es wert, alle "leicht zu nerven"?

  9. easton

    Nebenbei: Warum sind flache Klone böse? Ich dachte immer, sie wären billiger, aber ich schätze, das gilt wirklich nur für meinen Speicherplatz. (da der Server berechnen muss, welche Blobs er dir geben soll, anstatt einfach "alles"?)

  10. javcasas

    An diesem Punkt verwenden sie Residential-Proxies und ähnliches, und die Erhöhung des Schwierigkeitsgrades wird nicht helfen, unter anderem weil sie nicht dafür bezahlen.

    Warum können wir nicht dieses ganze Proof-of-Work-Ding in ein offizielles "Hilf mit, $SHITCOIN zu minen" verwandeln? Ich meine, wenn sie die Daten wirklich so dringend wollen, sollen sie wenigstens das Hosting mit ihren CPU/GPU/ASIC-Zyklen bezahlen.

Mehr von diesem Tag

2026-08-30