Hister: tu propio buscador privado que indexa todo tu historial
Hister – A private, full content search index that you control

Hister es un motor de búsqueda de código abierto y autoalojado que indexa el contenido completo de las páginas web que visitas y de tus archivos locales. Su extensión de navegador captura automáticamente cada sitio, permitiendo búsquedas de texto completo, búsqueda semántica con IA opcional, y consultas avanzadas con filtros. Incluye un rastreador con soporte para páginas con JavaScript, un servidor MCP para que asistentes de IA consulten tu historial, y una interfaz de terminal. Todo se mantiene en tu propia infraestructura, sin telemetría ni servicios de terceros.
Tu historial de navegación completo se vuelve buscable sin ningún esfuerzo manual.
- asciimoo
¡Hola! Soy el autor. ¡Gracias por publicar Hister. No dudes en preguntarme lo que quieras (AMA).
Mi primer proyecto de software libre de búsqueda fue Searx, un metabuscador que respeta la privacidad, pero debido a las limitaciones del concepto de metabúsqueda, decidí tomar un enfoque diferente.
Hister construye un índice de búsqueda personal a partir de las páginas que visitas, marcadores, historial del navegador, archivos locales y sitios web rastreados. Almacena el contenido extraído con vistas previas de resultados sin conexión, de modo que la información sigue siendo buscable incluso cuando la página original cambia o desaparece. Admite búsqueda de texto completo y semántica, puede ejecutarse por completo en tu propia máquina e incluye una interfaz web, herramientas de línea de comandos y un endpoint MCP para integraciones con asistentes.
Página del proyecto: https://github.com/asciimoo/hister
Demo de solo lectura: https://demo.hister.org/
- wmchen
Lo configuré hace unos meses basándome en los comentarios de asciimoo en HN, y al principio apenas lo usé, pero hace poco me di cuenta de que podría ser una herramienta de investigación bastante útil para uno de mis pasatiempos (viajes con millas), que gira en torno a estar al tanto de varios conceptos y peculiaridades.
Rastreé e importé publicaciones de los blogs que consulto regularmente para viajes con millas, luego lo conecté a OpenCode/Codex como servidor MCP y usé ese corpus para investigar sobre esos temas. Así puedo preguntar cosas como "¿alguien ha mencionado antes encontrarse con este problema?" [1]
Si tienes un pasatiempo o una situación laboral que requiera consultar regularmente un conjunto central de sitios web o materiales de referencia, Hister proporciona casi todas las herramientas listas para usar para iniciar un motor de búsqueda sobre ellos. Los conjuntos de datos predeterminados que promocionan incluyen la biblioteca estándar de Python, MDN y el corpus de RFC, por ejemplo. [2]
- quasigod
Acabo de terminar de configurarlo ayer y estoy un poco obsesionado con él. Antes era un gran usuario de Karakeep, pero odiaba olvidar guardar algo y perderlo. También creo que la búsqueda semántica de Hister es una mejor solución que los resúmenes y etiquetas generados por IA. El soporte para documentos locales también es genial; lo tengo configurado para indexar mi directorio de notas org.
- renegat0x0
He creado algo similar, aunque diferente. Mantengo mi propio índice de dominios de Internet.
https://github.com/rumca-js/Internet-Places-Database
También mantengo una aplicación Android que se puede usar para buscar lugares.
https://f-droid.org/en/packages/io.github.rumcajs.offlineweb...
Creo que en Hister tienes que llenarlo con tus datos, ¿verdad?
- Carrok
Probé esto esta semana y me gustó, pero realmente desearía que este proyecto tuviera algún tipo de autenticación. Abrir el contenido de cada página que has visitado, incluso a la red local, no es la mejor idea.
- vivzkestrel
- muchas preguntas estúpidas al autor de un tipo que no tiene idea de los motores de búsqueda
- digamos que quiero indexar todos los blogs que alguna vez aparecieron en HN
- debería ser un subconjunto pequeño de los 400 mil millones de páginas que hay en internet, ¿no?
- Primero necesito recopilar datos, ¿qué usas para cargar tantas páginas web rápidamente? ¿asyncio con aiohttp en Python? ¿hay mejores opciones?
- ¿cómo manejas los proxies? ¿rotación? ¿hay bibliotecas que recomiendes para esto?
- ¿qué pasa con las páginas que usan Cloudflare? ¿o que bloquean tu solicitud o presentan un captcha o algún tipo de desafío?
- ¿qué tipos de archivo recopilas? ¿solo HTML o también medios?
- ¿dónde y en qué formato almacenas todos estos archivos recopilados? ¿almacenamiento de archivos planos? ¿DuckDB? ¿PostgreSQL? ¿Hstore? ¿algo más?
- ¿con qué frecuencia actualizas cada página? ¿una vez al día? ¿una vez a la semana? ¿algo más?
- ¿qué tipo de preprocesamiento usas en los datos recopilados? ¿eliminar espacios extra? ¿caracteres especiales? ¿algún tipo de pipeline de expresiones regulares complejo? ¿LLM?
- ¿cómo haces coincidir la consulta entrante con los datos procesados? ¿coincidencia de texto simple? ¿regex? ¿coincidencia de vectores de incrustación? ¿algo más?
- evanjrowley
Aunque me encanta Karakeep, la verdad es que lo estoy usando para resolver exactamente este mismo problema, aunque sus objetivos de proyecto no están tan alineados. Consideraría seriamente probar Hister porque parece encajar mejor. Puntos extra por estar escrito en Go.
Supongo que lo único que necesitaría sería una forma fácil de compartir enlaces a Hister. Esperemos que veamos tanto aplicaciones móviles Android/iOS para enviar enlaces a Hister como un mejor soporte para Safari. Me pregunto qué sería posible con el soporte de extensiones disponible en los navegadores móviles también (Safari, MS Edge, Firefox).
- alexnewman
Es hora de promocionar descaradamente mi propio índice de búsqueda de contenido fácil de alojar
Webtm.io
Todo es de código abierto y lo suficientemente pequeño para implementar. Lo implemento en Cloudflare Workers, así que es el único lugar donde está probado.
Una cosa genial es que funciona en iOS, Chrome y similares, Firefox y prácticamente en todas partes. Requerimos que traigas tu propio LLM.