Token Saver:本地 MCP 扩展把 Claude 读 PDF 的成本砍到原来的 1/13
分类:ai-products · AI coding 基础设施
时间:2026-07-30 发布 v1.0
信源:Marktechpost 官方 GitHub 仓库(MIT 协议)、kiadev.net 实测、techsparking 二级报道
干啥的
把大 PDF 丢进 Claude Desktop 之前,先在本地索引好。你提问时,Claude 通过 MCP 协议调用这个本地工具,只拿到"和当前问题最相关的那几段 + 页码"。整个 PDF 不出你的硬盘,模型端只看到被裁剪到 8000 字符的精确片段。
底层是混合 RAG:BM25(关键词,权重 0.4,跑在 SQLite FTS5 上)+ 本地 all-MiniLM-L6-v2 嵌入(语义,权重 0.6)。两路打分后还要过一道"质量门"——纯语义命中的片段必须超过 0.25 相似度阈值才能进结果。
数据说话
实测三种文档(用 cl100k_base 估算):
| 文档 | 页数 | 整本 token | 工具返回 token | 节省 |
|---|---|---|---|---|
| FDA 药物标签 | 33 | 23,959 | 1,021 | 95.7% |
| GDPR 全文 | 88 | 70,260 | 996 | 98.6% |
| SFFA v. Harvard | 233 | 133,349 | 740 | 99.4% |
1000 页的教材丢进 Claude,原价每轮对话都重付整本的钱;走 Token Saver,每轮对话只付几百 token 的精确切片。文档越大省得越多,比例不是线性的。
为什么这件事不只是一个省 token 的小工具
-
付费逻辑改了。Claude 的计费是"上下文按 token 计费 + 每轮对话上下文重发"。Token Saver 砍的不是单次提问的成本,是"长文档 + 多轮对话"这个组合的成本结构。一个 200 页 PDF 的阅读会话,原本可能要 5-10 美元,跑 Token Saver 大概 0.5 美元。
-
MCP 生态从"通用工具"下沉到"领域工具"。Token Saver 不通用,只做 PDF 阅读这一件事。MIT 协议,17 个 commit,作者是罗切斯特理工的本科实习生 Arnav Rai,在 Marktechpost 实习时做的。说明个人开发者已经能写 MCP 工具并发布到生产。
-
本地优先的合规价值。法律、医疗、金融行业的 PDF 几乎不可能上传第三方服务。Token Saver 的设计是 folder allowlist + 零上传 + 仅元数据上 Claude,对这类工作流是"先合规、再谈功能"。
-
检索评估是开源的。仓库里有
eval/retrieval_eval.py和 RESULTS.md,recall@5 和 false-abstain 都有跑过的数据。Marktechpost 把 RAG 工具当成"可被评测的产品"做,不是"演示 demo"。
限制
- 嵌入模型可选:all-MiniLM-L6-v2 第一次使用要下载约 80MB。下载失败会自动降级成纯 BM25,检索质量有降但能跑。
- 不是所有 PDF 都吃:扫描件、纯图像 PDF 需要先 OCR;pypdfium2 提取失败的会走 pypdf 兜底。
- Windows 上 Stanford NLP 句子分割器偶尔报错,作者在 known-issues 里写了。
- 性能上限是 Claude 自身:返回片段质量再高,模型推理也只受 8000 字符约束的输入。
怎么看这一类工具
Token Saver 的真正意义不是"省 99% 钱",是让"大文档问答"这个用例从奢侈品变成日用品。所有做企业知识库、文档审阅、合规分析的团队,过去要让一个新人花 200 美元去"读懂 GDPR"才能开始工作;现在可以用 15 美元完成同样的活。
这就是 AI coding 工具一直在讲的故事换了一个场景:把单点功能封装成可插拔的 MCP 工具,让模型决定什么时候调用它,模型权重本身不升级,但工作流被打穿了一个洞。
原文链接:
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。