hister — 自分だけの検索エンジンを自宅で動かす

asciimoo氏が公開したGo製のセルフホスト型検索エンジン。ブラウザ履歴やローカルファイル、RFC文書などを取り込み、自分専用のインデックスを構築できる。GitHubでは3.8kスターを集め、DockerやNix、systemdによる運用にも対応。qutebrowser連携はDevTools経由に刷新され、CSPの影響を受けずにページ内容を安全に取り込めるようになった。
The companion keeps the access token outside inspected pages and avoids modifying the existing API protections.
HNでの議論
139- asciimoo
どうも、作者です!Histerを投稿してくれてありがとう。何でも聞いてください。
私の最初の自由ソフトウェア検索プロジェクトはSearxでした。プライバシーを尊重するメタ検索エンジンですが、メタ検索という概念の限界から、別のアプローチを取ることにしました。
Histerは、訪問したページ、ブックマーク、ブラウザ履歴、ローカルファイル、クロールしたウェブサイトから個人用の検索インデックスを構築します。抽出したコンテンツをオフラインの結果プレビュー付きで保存するので、元のページが変更されたり消えたりしても情報は検索可能なままです。全文検索とセマンティック検索をサポートし、完全に自分のマシン上で実行でき、ウェブインターフェース、コマンドラインツール、アシスタント統合用のMCPエンドポイントも備えています。
ウェブサイト: https://hister.org/
小さな読み取り専用デモ: https://demo.hister.org/
追伸: どうやら我々の名前は米国で登録商標と衝突しているようです。相手プロジェクトのオーナーから名前を変えるよう求められており、遅かれ早かれ従う必要がありそうです。
名前の提案を歓迎します!理想的には、比較的短く、響きが良く、.orgドメインが取得可能な名前がいいです。
ありがとう!
- taude
これとちょっと関連するんだけど、訪問したウェブページから知識を溜め込むために作ったもので、Karpathy風のLLM Wikiも実装している。でも知識は自分が閲覧したソースから自動的に収集される。
GitHubに上げてあるけど、誰も俺の実装を使うべきじゃないと思う。
ざっくり言うと、作ったものは:
* 各マシンでcronジョブが走っていて、すべてのウェブブラウザ履歴を調べる(通常はFirefoxとChromeのブラウザのSQLiteを検査)。もし自分のルールリスト(Hacker Newsのストーリー、特定のsubredditなど)にマッチしたら、ページを取得してmarkdownに変換し、Obsidian Vaultのincomingに放り込む。
* 複数のマシンで同じページを開くかもしれないので、重複排除のアーキテクチャが全体にある。処理済みリンクの追跡にはCloudFlare SQLITE D1ストレージを使用。
* その後、LLMをトリガーしてKarpathy wiki風の分類を記事に割り当て、整理し、インデックスを作成するなど。
そうすると、自分の「bot」的なもので文章を書くのに使える……これについてはいつかもっと書くと思う。完全に役に立つのか、それとも知識を溜め込むだけのヤクの毛刈りなのかは確信がない。
これについてAIが下書きした記事 [1]
先日のOllma vs LLama.cppに関する議論を元にAIが下書きした記事の例 [2]
[1] https://taude.xyz/posts/how-archivore-turns-browsing-into-a-...
[2] https://taude.xyz/posts/skip-ollama-run-llama-cpp-directly-o...
- devdoshi
こういうシステムが大好きで、上に構築できる便利なマッシュアップアプリがたくさんあるよね!
- rao-v
約4秒以上表示されていたタブだけを送信する拡張機能の設定が欲しい。
去年、自分がどんな情報を見ていたかを追跡する小さな拡張機能を作ったんだけど、焦点はその日/その週の「新しい情報」のまとめを生成することだった。
たくさんのページを開いて/さっと見て閉じることに気づいた。それはその特定のページに興味がないという強いシグナルで、その日に学んだ「新しい洞察」のソースにすべきではない(おそらくそのトピックに興味がないから)。
実際、Histerをバックエンドとして使う、そのプロジェクトのよりシンプルなバージョンを再試行してみたい。
- jval43
Google Chromeは2008年にこれをやっていた。訪問したすべてのページに対する全文検索で、オフラインで保存されていた。とても便利で、また使いたいと思っている。
誰も覚えていないようだが、当時は目玉機能だったのに。2013年に削除されたと思う、おそらく技術的な制約のためだろう。
絶対に試してみる。
- computator
使いたいけど、自分のLinuxディストリビューションでレビュー・承認されたパッケージ以外を使うのは躊躇する。ダウンロードしたプログラムにマルウェアや、作者自身も知らないようなセキュリティ問題(例えば使用ライブラリによるもの)がある確率が1%だとしても、そういうプログラムを50個も実行したら、システムが侵害される可能性が高い。これはブラウザアドオン、ブックマークレット、拡張機能にも当てはまる。
他の人はこのジレンマにどう対処しているんだろう?
思いつく解決策はどれも、多大な追加作業を伴う。
- phyzome
ほぼ同じ領域にZotero <https://www.zotero.org/> がある。研究資料を整理するためのものだが、訪問したウェブページを素早くアーカイブするのにも優れていて、クイックタグ付けや全文検索もできる。
- 361994752
同じ問題に長い間悩んでいたけど、今はほぼ解決した。単純にChatGPTに「ねえ、xについて何ヶ月か前に何か読んだんだけど、今見つけられない」と聞くようにしたんだ。驚くほど高い確率でチャットボットが正確な答えを返してくれる。たいていはおまけとして面白い読み物も追加で出してくれる。