週末に50万ドメインの検索エンジンを10ドルで自作した話
I Built a 500k-Domain Search Engine for Makers in a Weekend for $10

著者は2週末で約56万サイトのホームページをクロールし、各サイトをローカルLLMで要約して個人用検索エンジンを構築した。GPUレンタル料は約10ドル、ディスク使用量は1GB未満。コーポレートサイトやSEO記事に埋もれず、個人のポートフォリオやアートプロジェクトを見つけることを目的としている。クロールの優先順位を調整し、スチュワードと呼ばれるプロセスでスパムを自動ブロックするなど、工夫を凝らした。
「ウェブの90%は実はコーポレートサイトだ」
HNでの議論
86- iFire
あなたのアルゴリズムについての私の感想です:
1. 各サイトを読む
2. https://vast.ai で 4090 をレンタルして vllm を実行する
3. LLM モデルに独自のカテゴリ名とタグ名を自由に発明させる
4. それぞれ 1KB のメタデータを保存する
a. 各サイトを読み、名前、2〜3文の説明、カテゴリ、いくつかのタグを書く小さなローカル言語モデル。
5. コードは近日中にオープンソースとして公開予定 (TM)
- marginalia_nu
興味深いプロジェクトですね。ウェブサイトの発見は確かにかなり厳しい状況にあり、間違いなく革新が必要な分野です。自動ラベル付けされたウェブサイトディレクトリは、それほど馬鹿げたアイデアではありません。
私は、Marginalia Search で広告検出に使用しているレンダリング済みルートドキュメントの DOM サンプルが入った 400GB の SQLite データベースを持っていますが、これを使って同様のアイデアを探求したいと思っていました。
- headz
TS;DR: 雑すぎて読む気にならない。
- eichin
AltaVista のサーバーが 4GB の RAM で動作していたことを思い出します(当時有名だった回路基板の写真がありました。DEC が 30 年前に当然誇りに思っていたものです)。そして、現代の AltaVista はまともなラップトップで動作するはずです :-)
- frogger8
ドメインのリストが必要な方への情報です。
件名: すべてのドメインとサブドメインが欲しい
https://groups.google.com/g/common-crawl/c/XC2QmOE-sdI?pli=1
または COMMON CRAWL で検索してください。