Hister: ваш личный поисковик по всей истории браузера и файлам

Hister – A private, full content search index that you control

Hister: ваш личный поисковик по всей истории браузера и файлам

Hister — это самохостинговый поисковый движок с открытым исходным кодом, который индексирует посещённые веб-страницы и локальные файлы. Расширение для браузера автоматически сохраняет каждую посещённую страницу, делая её содержимое доступным для полнотекстового поиска, семантического поиска на основе AI-эмбеддингов и точных запросов с фильтрами. Поддерживаются обход сайтов, импорт истории из Chrome и Firefox, а также интеграция с AI-ассистентами через MCP-сервер. Все данные остаются на вашем устройстве — никакой телеметрии и облачных сервисов.

Ваша история браузера становится полностью доступной для поиска без каких-либо ручных усилий.
  1. asciimoo

    О, привет, я автор! Спасибо, что разместили Hister. Не стесняйтесь задавать вопросы (A.M.A.).

    Мой первый проект свободного ПО для поиска был Searx — метапоисковая система, уважающая конфиденциальность, но из-за ограничений концепции метапоиска я решил пойти другим путём.

    Hister строит личный поисковый индекс из посещаемых страниц, закладок, истории браузера, локальных файлов и обходов сайтов. Он сохраняет извлечённый контент с офлайн-превью результатов, так что информация остаётся доступной для поиска, даже если исходная страница изменится или исчезнет. Поддерживает полнотекстовый и семантический поиск, может полностью работать на вашей машине, включает веб-интерфейс, инструменты командной строки и MCP-эндпоинт для интеграции с ассистентами.

    Страница проекта: https://github.com/asciimoo/hister

    Небольшое демо только для чтения: https://demo.hister.org/

  2. wmchen

    Я настроил это несколько месяцев назад, основываясь на комментариях asciimoo на HN, и сначала почти не пользовался, но не так давно понял, что это может быть довольно полезным инструментом для одного из моих хобби (тревел-награды), которое вращается вокруг знания различных концепций и нюансов.

    Я спарсил и импортировал посты из блогов, которые регулярно использую для тревел-наград, затем подключил это к OpenCode/Codex как MCP-сервер и использовал этот корпус для исследований по этим темам. Так что я могу спрашивать что-то вроде "кто-нибудь упоминал, что сталкивался с этой проблемой раньше?" [1]

    Если у вас есть хобби или рабочая ситуация, требующая регулярного обращения к основному набору сайтов или справочных материалов, Hister предоставляет почти все инструменты из коробки для создания поисковой системы по ним. Стандартные наборы данных, которые они продвигают, включают, например, Python Stlib, MDN и корпус RFC. [2]

    [1]: https://wmchen.com/blog/revisiting-hister/

    [2]: https://hister.org/datasets

  3. quasigod

    Я только что закончил настройку этого вчера, и я просто одержим этим. Раньше я активно пользовался Karakeep, но ненавидел забывать что-то сохранить и терять это. Я также думаю, что семантический поиск Hister — лучшее решение, чем сгенерированные ИИ сводки и теги. Поддержка локальных документов тоже очень крутая: я настроил его на индексацию моей директории с org-заметками.

  4. renegat0x0

    Я создал нечто похожее, но иное. Я поддерживаю собственный индекс интернет-доменов.

    https://github.com/rumca-js/Internet-Places-Database

    Также я поддерживаю Android-приложение, которое можно использовать для поиска мест.

    https://f-droid.org/en/packages/io.github.rumcajs.offlineweb...

    Полагаю, в Hister вы должны сами заполнять данные, верно?

  5. Carrok

    Я попробовал это на этой неделе, и мне понравилось, но очень хотелось бы, чтобы в проекте была какая-то аутентификация. Открывать содержимое каждой страницы, которую вы когда-либо посещали, даже для локальной сети, — не лучшая идея.

  6. vivzkestrel

    - куча глупых вопросов автору от парня, который понятия не имеет о поисковых системах

    - допустим, я хочу проиндексировать каждый блог, когда-либо упомянутый на HN

    - это должно быть небольшое подмножество из 400 миллиардов страниц в интернете, не так ли?

    - Сначала мне нужно собрать данные: что вы используете для быстрой загрузки такого количества веб-страниц? asyncio с aiohttp в Python? Есть ли варианты лучше?

    - как вы обрабатываете прокси? ротацию? есть ли библиотеки, которые вы рекомендуете для этого?

    - а как насчёт страниц, использующих Cloudflare? или блокирующих ваш запрос, или показывающих капчу или какую-то проверку?

    - какие типы файлов вы собираете? только HTML или также медиа?

    - где и в каком формате вы храните все собранные файлы? плоское файловое хранилище? DuckDB? PostgreSQL? hstore? что-то ещё?

    - как часто вы обновляете каждую страницу? раз в день? раз в неделю? что-то другое?

    - какую предобработку вы используете на собранных данных? удаление лишних пробелов? специальных символов? какой-то сложный конвейер регулярных выражений? LLM?

    - как вы сопоставляете входящий запрос с обработанными данными? простое текстовое сопоставление? регулярные выражения? векторное эмбеддинг-сопоставление? что-то ещё?

  7. evanjrowley

    Хотя я люблю Karakeep, правда в том, что я использую его для решения той же самой проблемы, даже если его цели не так хорошо соответствуют. Я бы серьёзно рассмотрел возможность попробовать Hister, потому что он кажется более подходящим. Бонусные очки за то, что написан на Go.

    Полагаю, единственное, что мне нужно, — это простой способ делиться ссылками в Hister. Надеюсь, мы увидим мобильные приложения для Android/iOS для отправки ссылок в Hister и лучшую поддержку Safari. Интересно, что можно сделать с поддержкой расширений в мобильных браузерах (Safari, MS Edge, Firefox).

  8. alexnewman

    Время бесстыдно прорекламировать мой собственный простой в развёртывании индекс поиска по вашему контенту

    Webtm.io

    Всё с открытым исходным кодом и достаточно мало для развёртывания. Я разворачиваю на Cloudflare Workers, так что это единственное место, где он протестирован.

    Одна классная вещь — мы работаем на iOS, Chrome и других, Firefox и практически везде. Однако мы требуем, чтобы вы принесли свою собственную LLM.

Ещё за этот день

2026-08-22