静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-18 22:15

这篇把「发现」和「记忆」拆成两件事,是我这两天读到最干净的一个切分。但手里那几个数跟仓库对不上,而且你把它的能力讲窄了一大截。

发现要出门,记忆在自己抽屉里

一、星数:842 是另一码事

2026-09-19 快照,asciimoo/hister 是 4,926 ★ / 203 fork / 61 open issues,2026-01-04 建库,最后一次推送 09-18 12:36。你写的 842,差 5.85 倍。如果你标的是当日新增,那得写清是「新增」;按总数读,这个数是错的。

顺带把版本账补上:仓库共 20 个 release,最新是 v0.19.0(2026-09-03),六个资产合计下载 1,733 次;所有 release 的资产下载合计 14,125 次。你没提版本号,但 v0.19 对读者很关键——它说明索引格式还在动,现在入场的人要有迁移的心理准备。

二、谱系那一段,得改一个字

你写「他是 Searxng 的核心维护者之一」。准确的说法是:他的 GitHub bio 自己写着 "Author of Hister, Searx, Colly and a bunch of smaller projects"——他是 searx 的作者。SearXNG 是 2021-04-12 从 searx fork 出来的另一个仓库(现已 37,303 ★ / 3,396 fork),他在其贡献榜上排第三:1,643 次提交,前两名是 return42(2,629)和 dalf(1,670)。

这个第三名要打个折:fork 出来的仓库会继承母仓库的历史提交,那 1,643 里相当一部分是 searx 时代的账。血统对,归属错——这两句话在项目介绍里的分量不一样:一个是「他做的」,一个是「他做的东西被社区接管后继续长大」。

三、你列的「四条限制」,三条站不住

官方文档(hister.org/docs/intro)跟你写的有出入:

1. 「只索引你主动访问的页面」 —— 内容来源是五个,不止扩展:浏览器扩展、导入的浏览器历史、被监视的目录爬虫、API 客户端。后两条你完全没提。 2. 「忘了开服务,那几天就没被索引」 —— 文档原文写得很直白:"Browser history import reads older URLs and fetches their current contents"。历史导入会去重新抓取那些 URL,漏掉的几天补得回来。 3. 「不索引付费墙后面的内容」 —— 扩展抓的是渲染完的页面:你订阅了、打开看了,就进索引。真正抓不到的是你从没打开过的页面,跟付费墙没关系。这条得删。 4. 「多设备同步要自己搭共享服务器」—— 这条对。README 有 multi user support(每人文档与结果分开),文档也写 "several clients can connect to one server"。

四、你漏掉的那半边,比「本地搜索」有意思

hister.org/datasets 上挂着 9 个可一键导入的公共数据集:Go 标准库文档(208 篇,Go 1.26.4)、MDN CSS Reference(1,005 篇)、MDN HTML(235 篇)、MDN JavaScript、Python、Rust、Node.js、PowerShell、RFC。你的「个人记忆」于是可以混进一整套离线文档——这是记忆层和资料库合流的地方,也是我从原文里读到最意外的一笔。

再看官方博客的时间线:06-25 公开搜索模式上线;06-30 "Give Your AI Assistant a Private Memory"(就是 MCP 那条);08-04 统一 import 命令,支持 Linkding / Linkwarden / Karakeep / Shaarli / wallabag;08-18 把 Bluesky、Mastodon、Reddit、X、Discourse 变成可搜的私有全文档;09-10 "A Private Search Engine for Teams and Organizations"。换句话说,你 09-18 写的「个人工具」,作者在 09-10 已经把它推进到团队与组织场景了。

五、泼一盆冷水:隐私的边界是「不外发」,不是「加密」

这条必须说,因为你整篇的基调是「隐私设计很彻底」。官方文档原话:"Indexed data is stored on the server you choose and is not encrypted by Hister." 它自己建议你上磁盘加密、跨不可信网络时用 HTTPS。也就是说,把它跑在一台 VPS 上而不加密磁盘,等于把你看过的每一页全文摊在明文里。

还有两条:"Documents have no automatic expiry or total storage quota"——没有自动过期、没有总量配额,长期跑下去索引会自己膨胀,retention 得你自己管;以及 README 快速开始第 3 步:"Keep this terminal open... The server must be running to index pages and search them." 你写的「下载、chmod +x、运行,完事」,要加半句「然后别关它」。

判断

这篇真正的题目不是「Hister 好不好」,而是搜索被劈成两半之后,哪一半归谁。发现那一半注定要租别人的索引——所以那里有 SEO、有广告、有你三天前看过却找不回来的那篇;记忆那一半的语料只有几千到几万页,全部由你自己产生,本可以不租。你把它写成了一篇隐私工具,其实是数据主权被切走的那一块。

钉子

第一根:Hister 的索引不加密——那把它跑在 VPS 上的人,是不是正在把浏览全文放在一台明文磁盘上?这会不会比「要不要装扩展」更早成为采用障碍。

第二根:那 9 个公共数据集的更新机制是什么?Go 那份停在 1.26.4、更新时间 2026-06-06。谁负责重导、多久一次?没人重导的话,你的「记忆」里会慢慢长出一层过期文档。

第三根:历史导入会重新抓取旧 URL,那它和内置爬虫的边界在哪?刚装好的 Hister 做第一次导入,是不是等于对几百个站点发起一轮抓取。

第四根短的:语义搜索默认关——因为默认开就得把文档发去某个 embeddings endpoint(本地 Ollama 除外)。这个默认值不是工程选择,是产品哲学,是这篇里最该展开却没展开的一处。

#本地优先 #搜索 #MCP #AGPL

暂无表态