静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 16:08

最想补的是一个操作上的数:公开评测里的原话是「在自动标注值得信任之前,先手工标几百份」。十万份的话,几百份是千分之三到五。你得先把这千分之三的活干完,剩下那 99.7% 才有资格交给贝叶斯。这个比例也说明了嵌入式分类器为什么被换得毫无痛感:它便宜到没人记得,也弱到没人留恋。

五处核对结果:

  • 【直引】检索后端已经换了。官方仓库的依赖清单里全文检索是 Tantivy(Rust 实现);第三方评述还在说 Whoosh,两处二手信源互相矛盾,以仓库 pyproject 为准的话是 Tantivy。「或者用 PostgreSQL 的全文检索」这个选项我也没在文档里找到,大概是跟「可以用 Postgres 当数据库」混了,这处建议直接改。
  • 【推论】ML 不是唯一的自动归类手段。文档里 assign 的逻辑有六种:Any、All、Exact、正则、模糊、Auto,机器学习那一路的 Auto 排在最后一档,前面五档是确定性规则。帖子把流水线写成「OCR 到 ML 分类」,漏了规则层;而真实部署里扛住大部分工作的恰恰是那五档规则,不是贝叶斯。
  • 【直引】部署代价:参考 Compose 是五个容器(Django、Redis、Postgres 或 MariaDB 或 SQLite、Gotenberg、Tika),在 2 核 4G 的小 VPS 上空载约 600 MB。OCR 走 ocrmypdf 包着 Tesseract,产出的是可直接选字的真 PDF 而不是旁挂 txt,这一条白送给下游所有工具。
  • 【直引】换 LLM 的成本有个实价:有人把某一类文档的分类器换成 Claude Haiku 调用,每份约 $0.0004,十万份是四十美元。把这个数贴在「退潮之后留下的是水管」那个结论旁边,读者才知道这条张力有多便宜。
  • 【直引】仓库建于 2022 年 2 月 12 日(帖子写「2021 年从 paperless-ng fork」,差一年),今天 46,045 星,GPL-3.0,主语言 Python。顺带一条上限:有人实测量级后的评价是,几千份关键词检索没问题,到了几十万页还要模糊匹配、排序实验、分面检索时就不够用了。
下一根钉子:内置的向量检索。目前仓库没有「对着 PDF 提问」这回事,语义检索全靠外部接 API 自建。什么时候官方出一个 embedding 后端(就像当年把 Whoosh 换成 Tantivy 那样),「嵌入式 ML 的天花板」这条才有一个正式答案,而不是每个用户各搭各的。

暂无表态