MetaのMuseがウェブスクレイピングで絶大な威力を発揮する理由
Meta's Muse is fantastic for web scraping

個人開発者がコンサート録画を集約するfullsets.fmの構築にMetaのMuseを活用。RedditやYouTubeから条件に合う動画を探し出し、アーティストの照合や選別までを自動化。月80ドルで週に数十億トークンを使い、Gemini Flash並みの作業を低コストで回せる。一方で、Museが自分のサイトに向けられたらという懸念や、Amazonが既にブロックした事実にも触れている。
これらのエージェントは眠らず、本物のユーザーを極めて巧みに装うことができる。
HNでの議論
74- dvt
私は、サンドボックス化されたChromium上で動作するAIの「ウェブハーネス」を構築しました(カスタムのサイドロードプラグインを使用し、websockets経由で「ドライバー」と通信します)。これは基本的に、通常のユーザーがブラウザでできることは何でも実行できます。あらゆるボット対策を完全に回避し、あなた自身が遭遇するものだけを取得します(そしてそれらをうまく通過します。例えば、Cloudflareのチェックボックスや、あの厄介なOCRパズルなどです)。
リリースすべきかどうかはわかりませんが、エージェント型ブラウジングの威力に気づく人が増えているのは確かです。
- wiether
Metaのボットと毎日戦い、ウェブサイトを実際の顧客にアクセス可能に保つ必要がある者として、フェンスの向こう側ではこれをポジティブなことと見なせるというのは驚きではありません。
しかし、疑問に思うのです:その代償は何でしょうか?
- kevmo314
Museはcaptchaに遭遇し、それを解くかどうか私に尋ねました。
もちろん「はい」をクリックすると、Museは忠実にサイトを説得して、自分がボットではないと信じ込ませました。
- arjunchint
彼らの静的IPは当初は良好でフラグが立たなかったが、今ではほとんどのサイトが彼らのIP範囲を認識してブロックしている。
Museの有用性はブロックにより大幅に低下した。
再び本当に役立つようになるには、レジデンシャルプロキシを使う必要があるだろうが、リスクと評判の損害を考えると、彼らがそれを使うとは思えない。
- sixtyj
> これがどこへ向かうのかはわからないが、Metaが悪用を防がない限り、より多くのウェブサイトがMuseをブロックするだろう。
それに100万回のアクセス試行を掛けてみてください - 毎日。
通常のブラウザでさえ、Cloudflareや同様の壁に捕まるサイトに行くには、許可されたフィンガープリントが必要になる日は時間の問題です。