Supermemory 深度研究
github.com/supermemoryai/supermemory — 给 AI 的记忆与上下文引擎。开源的是什么,闭源的是什么,基准水分有多少。
文本版 · 供搜索与朗读
Supermemory 深度研究(代码库级)· 2026-09-07
Deep Research · 代码库级
Supermemory 深度研究
github.com/supermemoryai/supermemory — 给 AI 的记忆与上下文引擎。开源的是什么,闭源的是什么,基准水分有多少。
⭐ 29,246 stars
🍴 2,556 forks
📅 建库 2024-02-27
🌱 种子轮 $2.6M(2025-10)
🏔️ Cursor / Cognition / Klarna 在用
🔍 main @ 4d8a4ebf · 2026-09-02
一句话总评
开源的是"外围"(MCP server、SDK、消费端 App、文档),闭源的是"引擎"(记忆提取模型 + 时序向量图数据库)。工程质量非常高——尤其 MCP server,工程讲究程度罕见——但 README 的 "#1 on every major AI memory benchmark" 是厂商自评,"本地版开源"的说法与事实有出入:本地版只发布预编译二进制,tag 里没有引擎源码。
FINDING 01
引擎不在仓库里
"custom learning model + temporal vector-graph engine" 跑在闭源 Cloudflare Worker 上;仓库只有 MCP、SDK、消费端 Web 和文档。
FINDING 02
本地版 = 闭源二进制
supermemory local 从 GitHub Releases 下载 darwin/linux 预编译件,无 Windows 版;所有 server-v0.0.x tag 与 main 完全同构、无引擎源码。
FINDING 03
#1 全是自评
95% Recall@15 出自自家 research 页;Mastra/OMEGA/Hindsight 同期各自自评 ~95% SOTA,中立榜单不存在。MemoryBench 框架倒是开源可复跑。
1仓库真实布局:开什么源,不开什么源
Turbo + Bun monorepo,但 CLAUDE.md 是过期的——它描述的 "API Application (Primary Backend)"(Cloudflare Worker、Hyperdrive、IngestContentWorkflow、4 小时 cron)根本不在本仓库,那是闭源后端。仓库实际内容:
路径体量是什么
apps/docs71MBMintlify 文档站(引擎架构的唯一公开信源)
apps/web~73k 行 TS消费端 app.supermemory.ai(Next.js 16 + React 19)
apps/mcp~7.2k 行 TSMCP server(Hono + Cloudflare Workers)
packages/tools508KB@supermemory/tools,7 工具 × 多框架集成
packages/memory-graph~9.6k 行Canvas 2D 力导向记忆图可视化(npm 包)
Python 四包 + 扩展 + 演示场~7MBOpenAI / Agent Framework / Pipecat / Cartesia 集成、Raycast 与浏览器扩展
引擎(闭源)自述为 "custom learning model + temporal vector-graph engine"——自研学习模型决定记什么 / 忘什么 / 建什么关系,加上向量 / FTS / 图三合一的时序事实图;云上跑 Cloudflare Workers 栈(Hyperdrive 连 Postgres、Workers AI 嵌入、Workflows 摄取)。
2记忆引擎机制(文档 + API 形状反推)
每个文档产出三样东西:Chunks(原始 grounding,供 RAG)、Memories(图上的原子事实)、Profile(静态 + 动态用户摘要,常驻上下文)。
两阶段摄取:先索引,后 "dreaming"
queued毫秒级受理
extractingOCR / 转写 / 抓取
chunking类型感知切分
embedding → indexing到此 = done
dreaming ✦记忆提取 · 分组提炼 · 建图
done 只表示 chunk 索引完成;记忆提取是第二阶段 "dreaming"——dynamic 模式下相关文档先分组再一起提炼("记忆来自连贯单元,不是一次一个孤立写入"),done 之后还能继续长记忆。
图关系三型:updates(新事实取代旧事实,isLatest 标记,历史留审计)、extends(补充细节,两者都有效)、derives(跨记忆推断出用户没说过的事实,如"Alex 大概率在做 Stripe 核心支付")。
记忆三型:Facts(更新前永续)、Preferences(重复强化)、Episodes(衰减除非显著)。
遗忘:时间到期("明天考试"自动失效)+ 矛盾裁决 + 噪声过滤;显式控制有软删和 forget-matching 语义批量遗忘(带 dryRun)。
推断记忆人工复核:derived 事实标 isInference,确认前检索降权,复核队列按 parentCount(来源记忆数)排序。
Profile:static + dynamic(带日期前缀)+ buckets,文档口径"3-5 次查询 → 1 次调用,200-500ms → 50-100ms"。query 无法命中的偏好("叫我 Dhravya")只有 profile 能带回——这是它对纯检索 RAG 的核心卖点。
检索:POST /v4/search,searchMode: memories|documents|hybrid;rerank(cross-encoder,+~100ms)、rewriteQuery(+~400ms)、include.relatedMemories 暴露图边;示例 timing 92ms,平台口径 p50 < 300ms。
规模口径:单容器 1M 文档 / 10M 记忆;每事实平均 ~10 token,50 条 ≈ 500 token 上下文。
3API 面(v3 摄取 + v4 记忆,两代并存)
摄取 POST /v3/documents(毫秒级受理返回 queued)、/v3/documents/file(≤50MB)、POST /v4/conversations(回合感知,customId 重复提交按 max(0, 全量-已见) diff 计费——重复同步免费,聪明且诚实的设计)。
记忆 v4:直接写(1-100 条/次)、版本化 PATCH(旧版 isLatest=false)、软删 forget、语义批量 forget-matching。作用域靠 containerTag 硬隔离 + 容器级限流 scoped key(默认 500 req/60s)。连接器(Drive / Gmail / Notion / OneDrive / GitHub / Granola / Web Crawler)是平台专属,本地版没有。
4Supermemory local:预编译二进制,"开源"存疑
curl -fsSL https://supermemory.ai/install | bash 装的是本仓库 GitHub Releases(server-v0.0.8)上的 darwin/linux 预编译二进制(没有 Windows 版),端口 6767,数据全在 ./.supermemory/,零遥测。内置本地嵌入 Xenova/bge-base-en-v1.5(768d,ONNX via WASM,可换 OpenAI / Gemini / Ollama,维度不符拒绝启动);内存 governor 默认 1GB,摄取并发 2,搜索即时、添加走队列。
⚠ 与事实的出入文档说 "it's open source (git.new/memory)",但 main 和所有 server-v0.0.x tag 里都没有引擎源码(tag 树与 main 完全同构,只有外围)。本地版"提取用你自己的模型"(OpenAI 默认 gpt-5.1,Anthropic 钉死 claude-haiku-4-5),云端用"专有长程模型"——本地版是免费增值引流件,不是开源引擎。v0.0.5 曾有嵌入计划读写不一致导致日文精确搜索静默空结果的 bug,v0.0.7 修复。
5MCP server(apps/mcp,工程质量标杆)
Streamable HTTP,每个请求新建 McpServer(stateless)。鉴权双轨:sm_ API key(验证结果 per-isolate 缓存 60s/1000 条)或 OAuth JWT(JWKS 验签)。上游认证后端挂掉时返回 503 + Retry-After 而非 401——防止客户端丢弃有效凭据,这种细节很少见。
15 个工具分三层(模型只见前 7 个)
层工具要点
A 模型可见search_memoryprofile + hybrid 检索合成 markdown,相似度百分比行
listDocuments / getDocument分页列表(下一页 nudge)/ 跨空间读全文(20 万字符截断)
listMemories直连 /v4/memories/list,滤掉已遗忘 / 非最新
listSpaces / whoAmI空间发现 / RBAC 自省(accessType / assignedSpaces / scope)
add_memorysave/forget 二合一;forget 精确匹配 404 后走 0.85 阈值相似删除
—— 模型看不见的下面还有 8 个 ——
B App 启动器 ×4select-space / memory-graph / guided-save / upload-file拉起内嵌单文件 HTML 部件,描述里全是行为钳制("别为搜个空间就调我""别再画一张重复的图")
C 仅 App ×4set-active-tag / save-memory / prepare-file-upload / fetch-graph-data_meta.ui.visibility:["app"] 对模型隐藏,是 App 部件的回程端点
亮点:两阶段上传(DO 只存 uploadToken 的 SHA-256,2 分钟 alarm TTL,原子消费,multipart 直通,widget 拿不到真 token);PostHog 埋点用装饰器包 registerTool 零侵入;server↔widget 契约 discriminated union,加视图是编译错误;context prompt(即 /context)输出 8 静态 + 8 动态事实。
6SDK / 集成面
7 工具一次定义、五端复用(AI SDK / OpenAI / Mastra / VoltAgent / Python)。
withSupermemory(Vercel AI SDK):Proxy 拦 doGenerate/doStream → 取最后一条用户消息 → POST /v4/profile(5s 超时,LRU 100 缓存)→ 去重(归一化后 静态 > 动态 > 检索 保序)→ 以 <supermemory context="user-memories" readonly> XML 块注入 system prompt → 生成后存回 /v4/conversations;取记忆失败默认静默跳过。
Claude Memory Tool 适配六命令全实现(view / create / str_replace / insert / delete / rename;文件=文档,customId=路径归一化 memories_x_txt)。
Python 四包:openai-sdk 最全(同步异步 monkey-patch + 7 工具);pipecat 做语音(<user_memories> 包裹注入 + 重叠 diff 增量存储);cartesia 拦 UserTurnEnded。
7消费端 Web(apps/web,~73k 行 TS)
Nova agent 闭源:chat 走 api.supermemory.ai/chat(AI SDK v6 流),仓库只有 UI 壳。模型菜单:grok-4.5 / gpt-5.6-terra / claude-sonnet-5 / gemini-3.1-pro-preview。工具面从流部件反推:searchMemories / recallContext / discoverSpaces / updateMemory / forgetMemory / forgetDocument + 动态 web search。
记忆图旁路实时高亮 Nova 本次引用的文档("N memories used by Nova")。Agent 空间归并:正则分类学把 Claude Code / Codex / OpenCode / Cursor 写的记忆折叠成每项目一个 "Agents" 空间——编码 agent 的记忆在消费端是一等公民。Next.js 16 经 @opennextjs/cloudflare 上 Workers,绑定仅 ASSETS + 自引用 + R2 增量缓存。
8商业模式
Free $0(送 $5 credits/月)→ Pro $19 → Scale $399 → Enterprise。计量:text token $5/1M、rich $10/1M、superrag 模式 5 折(跳过记忆提取只做 RAG)、搜索 $5/1M 次、operation $0.1/次。余额耗尽 402、功能门槛 403。SOC 2 Type II、GDPR、HIPAA BAA(Scale+);"客户内容永不用于训练——所有套餐一致"。直接提供 from-mem0 / from-zep 迁移指南。
9基准声明核实(重要)
README 宣称三大基准 #1(LongMemEval / LoCoMo / ConvoMem)、95% Recall@15 @ ~720 tokens(99.4% 上下文压缩)。核实结果:
结论数字全部出自自家 research 页,docs 站反而克制不给数;不存在中立第三方榜单(LongMemEval 官方学术站不 host 商业厂商榜)。
同期至少四家竞品同样自评 ~95% SOTA,互相矛盾,说明该指标已被厂商营销饱和:
厂商自评分数口径
Supermemory95% Recall@15自家 research 页,+~720 tokens 上下文
Mastra Observational Memory94.87%"highest score ever recorded"(gpt-5-mini)
OMEGA95.4%自称 50ms 检索
Hindsight / Vectorize94.6%称"独立验证"
Exabase M-1~SOTA研究模型规模 vs 长期记忆
可信的部分:MemoryBench 框架本身开源(MIT,provider 接口统一),任何人可复跑 supermemory / mem0 / zep + filesystem / rag 基线——把自评变成可复核是诚意之举,但默认榜单仍是自家维护。另一自评:SMFS 在 110 题 xAFS 上比 Claude 原生省 3.0× token(24M vs 72M)。
10工程质量与吐槽
👍 好的
MCP 的工程纪律:zod 全边界、回滚 DO 保留一个版本、503/401 错误分类
diff 计费 + customId 幂等摄取,聪明且诚实
SSRF 防护做到 CGNAT 段级、IPv6 字面量、2MB 有界读
web 端对 AI SDK v6 工具部件缺陷的 load-bearing 注释
👎 存疑 / 差评
"Open source" 营销与事实不符:引擎闭源、local binary-only、tag 无源码、#1 全自评
CLAUDE.md 描述不存在的后端,误导 agent 开发者
docs 有一批明显乱码段落(疑似批量编辑事故)
v3/v4 双 API 并存;SDK 里留着"pinned SDK 没有 forget 所以 raw DELETE"的补丁痕迹
self-host 与云端"专有模型"不是同一个东西,文档用一整页 local-vs-enterprise 圆落差
11借鉴价值
MCP 三层工具分级(模型可见 / App 启动器 / App hidden)是"工具太多污染注意力"的现成范式。
Profile 作为检索旁路:query 命不中的事实必须走 always-on 摘要,任何记忆系统都该有这条非对称通道。
推断记忆默认降权 + 人工复核(parentCount 排序)是防 LLM 记忆幻觉污染的务实折中。
diff 计费 + customId 幂等摄取:把"重复同步免费"做成计费原语,连接器类产品通用。
withSupermemory 的"取记忆失败静默降级、只增不阻断"是给 LLM 加旁路依赖的安全姿势。
时序图(updates / extends / derives + isLatest + forgetAfter)比扁平 fact 列表表达力强,但复杂度转移给了搜索侧 temporal filtering。
§信源
代码:C:/GitHub/supermemory(apps/mcp、apps/web、apps/docs、packages/tools 等,行级引用见配套 md 笔记 supermemory_深度研究_2026-09-07.md)
TechCrunch:19 岁创始人获 Google 高管背书($2.6M)
Supermemory 官方融资公告(自宣 $3M)
Supermemory LongMemEval 自评页 · LongMemEval 官方(学术,无商业榜单)
竞品同期自评:Mastra 94.87% · OMEGA 95.4% · Hindsight 94.6% · Exabase M-1
GitHub API:repo 统计与 server-v0.0.8 release 资产清单(2026-09-07 抓取)
Supermemory 深度研究 · 2026-09-07 · 自包含 HTML,离线可开
克隆:C:/GitHub/supermemory · main @ 4d8a4ebf