Hister: ваш личный поисковик по всей истории браузера и файлам
Hister – A private, full content search index that you control

Hister — это самохостинговый поисковый движок с открытым исходным кодом, который индексирует посещённые веб-страницы и локальные файлы. Расширение для браузера автоматически сохраняет каждую посещённую страницу, делая её содержимое доступным для полнотекстового поиска, семантического поиска на основе AI-эмбеддингов и точных запросов с фильтрами. Поддерживаются обход сайтов, импорт истории из Chrome и Firefox, а также интеграция с AI-ассистентами через MCP-сервер. Все данные остаются на вашем устройстве — никакой телеметрии и облачных сервисов.
Ваша история браузера становится полностью доступной для поиска без каких-либо ручных усилий.
- asciimoo
О, привет, я автор! Спасибо, что разместили Hister. Не стесняйтесь задавать вопросы (A.M.A.).
Мой первый проект свободного ПО для поиска был Searx — метапоисковая система, уважающая конфиденциальность, но из-за ограничений концепции метапоиска я решил пойти другим путём.
Hister строит личный поисковый индекс из посещаемых страниц, закладок, истории браузера, локальных файлов и обходов сайтов. Он сохраняет извлечённый контент с офлайн-превью результатов, так что информация остаётся доступной для поиска, даже если исходная страница изменится или исчезнет. Поддерживает полнотекстовый и семантический поиск, может полностью работать на вашей машине, включает веб-интерфейс, инструменты командной строки и MCP-эндпоинт для интеграции с ассистентами.
Страница проекта: https://github.com/asciimoo/hister
Небольшое демо только для чтения: https://demo.hister.org/
- wmchen
Я настроил это несколько месяцев назад, основываясь на комментариях asciimoo на HN, и сначала почти не пользовался, но не так давно понял, что это может быть довольно полезным инструментом для одного из моих хобби (тревел-награды), которое вращается вокруг знания различных концепций и нюансов.
Я спарсил и импортировал посты из блогов, которые регулярно использую для тревел-наград, затем подключил это к OpenCode/Codex как MCP-сервер и использовал этот корпус для исследований по этим темам. Так что я могу спрашивать что-то вроде "кто-нибудь упоминал, что сталкивался с этой проблемой раньше?" [1]
Если у вас есть хобби или рабочая ситуация, требующая регулярного обращения к основному набору сайтов или справочных материалов, Hister предоставляет почти все инструменты из коробки для создания поисковой системы по ним. Стандартные наборы данных, которые они продвигают, включают, например, Python Stlib, MDN и корпус RFC. [2]
- quasigod
Я только что закончил настройку этого вчера, и я просто одержим этим. Раньше я активно пользовался Karakeep, но ненавидел забывать что-то сохранить и терять это. Я также думаю, что семантический поиск Hister — лучшее решение, чем сгенерированные ИИ сводки и теги. Поддержка локальных документов тоже очень крутая: я настроил его на индексацию моей директории с org-заметками.
- renegat0x0
Я создал нечто похожее, но иное. Я поддерживаю собственный индекс интернет-доменов.
https://github.com/rumca-js/Internet-Places-Database
Также я поддерживаю Android-приложение, которое можно использовать для поиска мест.
https://f-droid.org/en/packages/io.github.rumcajs.offlineweb...
Полагаю, в Hister вы должны сами заполнять данные, верно?
- Carrok
Я попробовал это на этой неделе, и мне понравилось, но очень хотелось бы, чтобы в проекте была какая-то аутентификация. Открывать содержимое каждой страницы, которую вы когда-либо посещали, даже для локальной сети, — не лучшая идея.
- vivzkestrel
- куча глупых вопросов автору от парня, который понятия не имеет о поисковых системах
- допустим, я хочу проиндексировать каждый блог, когда-либо упомянутый на HN
- это должно быть небольшое подмножество из 400 миллиардов страниц в интернете, не так ли?
- Сначала мне нужно собрать данные: что вы используете для быстрой загрузки такого количества веб-страниц? asyncio с aiohttp в Python? Есть ли варианты лучше?
- как вы обрабатываете прокси? ротацию? есть ли библиотеки, которые вы рекомендуете для этого?
- а как насчёт страниц, использующих Cloudflare? или блокирующих ваш запрос, или показывающих капчу или какую-то проверку?
- какие типы файлов вы собираете? только HTML или также медиа?
- где и в каком формате вы храните все собранные файлы? плоское файловое хранилище? DuckDB? PostgreSQL? hstore? что-то ещё?
- как часто вы обновляете каждую страницу? раз в день? раз в неделю? что-то другое?
- какую предобработку вы используете на собранных данных? удаление лишних пробелов? специальных символов? какой-то сложный конвейер регулярных выражений? LLM?
- как вы сопоставляете входящий запрос с обработанными данными? простое текстовое сопоставление? регулярные выражения? векторное эмбеддинг-сопоставление? что-то ещё?
- evanjrowley
Хотя я люблю Karakeep, правда в том, что я использую его для решения той же самой проблемы, даже если его цели не так хорошо соответствуют. Я бы серьёзно рассмотрел возможность попробовать Hister, потому что он кажется более подходящим. Бонусные очки за то, что написан на Go.
Полагаю, единственное, что мне нужно, — это простой способ делиться ссылками в Hister. Надеюсь, мы увидим мобильные приложения для Android/iOS для отправки ссылок в Hister и лучшую поддержку Safari. Интересно, что можно сделать с поддержкой расширений в мобильных браузерах (Safari, MS Edge, Firefox).
- alexnewman
Время бесстыдно прорекламировать мой собственный простой в развёртывании индекс поиска по вашему контенту
Webtm.io
Всё с открытым исходным кодом и достаточно мало для развёртывания. Я разворачиваю на Cloudflare Workers, так что это единственное место, где он протестирован.
Одна классная вещь — мы работаем на iOS, Chrome и других, Firefox и практически везде. Однако мы требуем, чтобы вы принесли свою собственную LLM.