El asedio de los scrapers de IA alcanza nuevas cotas y la web abierta se resquebraja
An Update on the scraper situation
Un año después de que LWN documentara el problema, el scraping masivo de sitios web para entrenar modelos de IA no ha hecho más que crecer. Los ataques, orquestados a través de redes de proxies residenciales que secuestran millones de dispositivos, ahora superan cualquier defensa conocida. LWN relata cómo Google ha tumbado dos de estas redes (IPIDEA y NetNut), pero la calma es temporal. Mientras tanto, los operadores legítimos se ven obligados a levantar muros: pruebas de trabajo, CAPTCHAs, muros de pago... Una carga que recae sobre toda la web. El artículo también señala que las grandes empresas de IA, aunque respetan robots.txt, siguen siendo opacas sobre sus fuentes de datos, y que la industria parece cómoda con destruir los sitios independientes tras saquearlos.
La industria que impulsa estos ataques parece sentirse muy a gusto convirtiendo los sitios web independientes en cráteres humeantes después de haber saqueado su contenido — una actitud que se extiende también al planeta y a sus economías.