Hister:把搜索引擎装进自己的服务器

Hister:把搜索引擎装进自己的服务器

厌倦了商业搜索引擎的追踪和算法推荐?Hister 是一个让你完全掌控的开源个人搜索引擎项目。它不仅能索引本地文件,还能通过 Docker 容器轻松部署,甚至支持通过 qutebrowser 的 DevTools 接口抓取网页内容。项目拥有超过 3800 个 Star,社区活跃,近期更新频繁,包括优化容器构建、修复符号链接监控问题以及增强安全策略。对于注重隐私和数据主权的开发者来说,Hister 提供了一个构建私有搜索基础设施的绝佳方案,让你重新掌握信息检索的主动权。

Hister 让你能够索引本地文件、监控目录变化,并通过本地部署的服务器实现完全私有的搜索体验。
  1. asciimoo

    Ohi,作者在此!感谢发布 Hister。欢迎随时提问(A.M.A.)。

    我的第一个自由软件搜索项目是 Searx,一个尊重隐私的元搜索引擎,但由于元搜索概念的局限性,我决定尝试不同的方向。

    Hister 会根据你访问的页面、书签、浏览器历史记录、本地文件以及爬取的网站构建个人搜索索引。它存储提取的内容并提供离线结果预览,因此即使原始页面发生变化或消失,信息依然可被搜索。它支持全文搜索和语义搜索,可完全在本地机器上运行,并包含 Web 界面、命令行工具以及用于助手集成的 MCP 端点。

    网站:https://hister.org/

    微型只读演示:https://demo.hister.org/

    附注:看来我们的名字与美国的一个注册商标冲突了。另一个项目的拥有者要求我们改名,所以我们迟早得照办。

    欢迎提供名字建议!理想情况下,新名字应该相对简短、听起来不错,并且有可用的 .org 域名。

    谢谢!

  2. taude

    这有点相关,因为我构建它的初衷是为了囤积我访问过的网页知识,同时实现一个 Karpathy 风格的 LLM Wiki,不过这些知识是从我浏览的来源自动收集的。

    我已经把它放到了 GitHub 上,但我不认为任何人应该使用我的实现。

    粗略来说,我构建的内容如下:

    * 在我的每台机器上,都有一个 cron 任务在运行,它会检查我所有的浏览器历史记录(通常是跨 Firefox 和 Chrome 检查浏览器的 SQLite 数据库)。如果匹配我的规则列表(如 Hacker News 故事、特定的 Reddit 板块等),它就會抓取页面,转换为 Markdown,然后放入我的 Obsidian Vault 的 incoming 文件夹。

    * 它拥有一套完整的去重架构,因为我可能会在多台机器上打开同一个页面。它使用 CloudFlare 的 SQLITE D1 存储来跟踪已处理的链接。

    * 然后它会触发 LLM 对文章进行 Karpathy Wiki 风格的分类分配、组织内容、创建索引等。

    之后,我的“机器人”就可以利用这些内容为我撰写文章了……我可能会在某个时候写更多关于它的东西。我不确定这是否真的有用,还是仅仅是在囤积知识上的“修驴毛”(yak-shave)。

    关于此主题的 AI 草稿文章 [1]

    基于前几天关于 Ollama vs LLama.cpp 讨论的 AI 草稿文章示例 [2]

    [1] https://taude.xyz/posts/how-archivore-turns-browsing-into-a-...

    [2] https://taude.xyz/posts/skip-ollama-run-llama-cpp-directly-o...

  3. rao-v

    我很希望能有一个扩展设置,只发送那些可见时间约为 4 秒或更久的标签页。

    去年我自己写了一个小扩展,用来追踪我查看的信息,但重点在于生成每日/每周的“新信息”摘要。

    我意识到我会打开或快速查看很多页面然后关闭它们,这是一个强烈的信号,表明我不在乎那个特定的页面,它不应该成为我那天学到的“新见解”的来源(因为我可能根本不关心那个主题)。

    我很想重新尝试一个更简单的版本,实际上以 Hister 作为后端来构建该项目。

  4. jval43

    Google Chrome 在 2008 年做过这个。对所有访问过的页面进行全文搜索,并离线存储。它非常有用,我很怀念它。

    似乎没人记得它了,尽管它当时是一个头条功能。我想是在 2013 年移除的,可能是由于技术限制。

    肯定会试试这个。

  5. computator

    我想用它,但我犹豫是否要使用任何不是我的 Linux 发行版中经过审查和批准的软件包。即使我下载的某个程序有 1% 的概率包含恶意软件或安全问题(即使作者自己都不知道,例如由于使用的库),如果我运行 50 个这样的程序,我的系统被入侵的几率就很大了。这也适用于浏览器插件、书签脚本和扩展。

    其他人是如何处理这个困境的?

    我能想到的唯一解决方案都涉及大量的额外工作。

  6. 361994752

    我有很长一段时间都有同样的问题,但现在基本解决了。我开始直接问 ChatGPT:“嘿,我几个月前读过关于 x 的东西,但现在找不到了”。令人惊讶的是,聊天机器人很有可能会直接给我确切的答案,通常还会附带一些有趣的阅读材料作为额外收获。

  7. phyzome

    大致在同一领域的是 Zotero <https://www.zotero.org/>,它旨在用于整理研究材料,但也是快速归档你访问过的网页的好方法,包括快速标签和全文搜索。

  8. jamienk

    https://bugzilla.mozilla.org/show_bug.cgi?id=342916

    我可以给页面添加笔记吗?这可能是一个不错的地方来做到这一点……?也许界面可以放在网页上而不是终端里?

    在 Google 崛起之前,围绕搜索有一个充满活力的 FOSS 开发生态系统,涵盖了它的各种小方面。然后 Google 之后,人们不再折腾搜索了,搜索变得“已解决”或者“必须由大玩家来写代码”。真可惜。

    谢谢你,这真是等了太久太久。

同日更多故事

2026-09-17