Supermemory 深度研究

github.com/supermemoryai/supermemory — 给 AI 的记忆与上下文引擎。开源的是什么,闭源的是什么,基准水分有多少。

文本版 · 供搜索与朗读

Supermemory 深度研究(代码库级)· 2026-09-07

Deep Research · 代码库级

Supermemory 深度研究

github.com/supermemoryai/supermemory — 给 AI 的记忆与上下文引擎。开源的是什么,闭源的是什么,基准水分有多少。

⭐ 29,246 stars
🍴 2,556 forks
📅 建库 2024-02-27
🌱 种子轮 $2.6M(2025-10)
🏔️ Cursor / Cognition / Klarna 在用
🔍 main @ 4d8a4ebf · 2026-09-02

一句话总评
开源的是"外围"(MCP server、SDK、消费端 App、文档),闭源的是"引擎"(记忆提取模型 + 时序向量图数据库)。工程质量非常高——尤其 MCP server,工程讲究程度罕见——但 README 的 "#1 on every major AI memory benchmark" 是厂商自评,"本地版开源"的说法与事实有出入:本地版只发布预编译二进制,tag 里没有引擎源码。

FINDING 01

引擎不在仓库里

"custom learning model + temporal vector-graph engine" 跑在闭源 Cloudflare Worker 上;仓库只有 MCP、SDK、消费端 Web 和文档。

FINDING 02

本地版 = 闭源二进制

supermemory local 从 GitHub Releases 下载 darwin/linux 预编译件,无 Windows 版;所有 server-v0.0.x tag 与 main 完全同构、无引擎源码。

FINDING 03

#1 全是自评

95% Recall@15 出自自家 research 页;Mastra/OMEGA/Hindsight 同期各自自评 ~95% SOTA,中立榜单不存在。MemoryBench 框架倒是开源可复跑。

1仓库真实布局:开什么源,不开什么源

Turbo + Bun monorepo,但 CLAUDE.md 是过期的——它描述的 "API Application (Primary Backend)"(Cloudflare Worker、Hyperdrive、IngestContentWorkflow、4 小时 cron)根本不在本仓库,那是闭源后端。仓库实际内容:

路径体量是什么

apps/docs71MBMintlify 文档站(引擎架构的唯一公开信源)

apps/web~73k 行 TS消费端 app.supermemory.ai(Next.js 16 + React 19)

apps/mcp~7.2k 行 TSMCP server(Hono + Cloudflare Workers)

packages/tools508KB@supermemory/tools,7 工具 × 多框架集成

packages/memory-graph~9.6k 行Canvas 2D 力导向记忆图可视化(npm 包)

Python 四包 + 扩展 + 演示场~7MBOpenAI / Agent Framework / Pipecat / Cartesia 集成、Raycast 与浏览器扩展

引擎(闭源)自述为 "custom learning model + temporal vector-graph engine"——自研学习模型决定记什么 / 忘什么 / 建什么关系,加上向量 / FTS / 图三合一的时序事实图;云上跑 Cloudflare Workers 栈(Hyperdrive 连 Postgres、Workers AI 嵌入、Workflows 摄取)。

2记忆引擎机制(文档 + API 形状反推)

每个文档产出三样东西:Chunks(原始 grounding,供 RAG)、Memories(图上的原子事实)、Profile(静态 + 动态用户摘要,常驻上下文)。

两阶段摄取:先索引,后 "dreaming"

queued毫秒级受理

extractingOCR / 转写 / 抓取

chunking类型感知切分

embedding → indexing到此 = done

dreaming ✦记忆提取 · 分组提炼 · 建图

done 只表示 chunk 索引完成;记忆提取是第二阶段 "dreaming"——dynamic 模式下相关文档先分组再一起提炼("记忆来自连贯单元,不是一次一个孤立写入"),done 之后还能继续长记忆。

图关系三型:updates(新事实取代旧事实,isLatest 标记,历史留审计)、extends(补充细节,两者都有效)、derives(跨记忆推断出用户没说过的事实,如"Alex 大概率在做 Stripe 核心支付")。

记忆三型:Facts(更新前永续)、Preferences(重复强化)、Episodes(衰减除非显著)。

遗忘:时间到期("明天考试"自动失效)+ 矛盾裁决 + 噪声过滤;显式控制有软删和 forget-matching 语义批量遗忘(带 dryRun)。

推断记忆人工复核:derived 事实标 isInference,确认前检索降权,复核队列按 parentCount(来源记忆数)排序。

Profile:static + dynamic(带日期前缀)+ buckets,文档口径"3-5 次查询 → 1 次调用,200-500ms → 50-100ms"。query 无法命中的偏好("叫我 Dhravya")只有 profile 能带回——这是它对纯检索 RAG 的核心卖点。

检索:POST /v4/search,searchMode: memories|documents|hybrid;rerank(cross-encoder,+~100ms)、rewriteQuery(+~400ms)、include.relatedMemories 暴露图边;示例 timing 92ms,平台口径 p50 < 300ms。

规模口径:单容器 1M 文档 / 10M 记忆;每事实平均 ~10 token,50 条 ≈ 500 token 上下文。

3API 面(v3 摄取 + v4 记忆,两代并存)

摄取 POST /v3/documents(毫秒级受理返回 queued)、/v3/documents/file(≤50MB)、POST /v4/conversations(回合感知,customId 重复提交按 max(0, 全量-已见) diff 计费——重复同步免费,聪明且诚实的设计)。

记忆 v4:直接写(1-100 条/次)、版本化 PATCH(旧版 isLatest=false)、软删 forget、语义批量 forget-matching。作用域靠 containerTag 硬隔离 + 容器级限流 scoped key(默认 500 req/60s)。连接器(Drive / Gmail / Notion / OneDrive / GitHub / Granola / Web Crawler)是平台专属,本地版没有。

4Supermemory local:预编译二进制,"开源"存疑

curl -fsSL https://supermemory.ai/install | bash 装的是本仓库 GitHub Releases(server-v0.0.8)上的 darwin/linux 预编译二进制(没有 Windows 版),端口 6767,数据全在 ./.supermemory/,零遥测。内置本地嵌入 Xenova/bge-base-en-v1.5(768d,ONNX via WASM,可换 OpenAI / Gemini / Ollama,维度不符拒绝启动);内存 governor 默认 1GB,摄取并发 2,搜索即时、添加走队列。

⚠ 与事实的出入文档说 "it's open source (git.new/memory)",但 main 和所有 server-v0.0.x tag 里都没有引擎源码(tag 树与 main 完全同构,只有外围)。本地版"提取用你自己的模型"(OpenAI 默认 gpt-5.1,Anthropic 钉死 claude-haiku-4-5),云端用"专有长程模型"——本地版是免费增值引流件,不是开源引擎。v0.0.5 曾有嵌入计划读写不一致导致日文精确搜索静默空结果的 bug,v0.0.7 修复。

5MCP server(apps/mcp,工程质量标杆)

Streamable HTTP,每个请求新建 McpServer(stateless)。鉴权双轨:sm_ API key(验证结果 per-isolate 缓存 60s/1000 条)或 OAuth JWT(JWKS 验签)。上游认证后端挂掉时返回 503 + Retry-After 而非 401——防止客户端丢弃有效凭据,这种细节很少见。

15 个工具分三层(模型只见前 7 个)

层工具要点

A 模型可见search_memoryprofile + hybrid 检索合成 markdown,相似度百分比行

listDocuments / getDocument分页列表(下一页 nudge)/ 跨空间读全文(20 万字符截断)

listMemories直连 /v4/memories/list,滤掉已遗忘 / 非最新

listSpaces / whoAmI空间发现 / RBAC 自省(accessType / assignedSpaces / scope)

add_memorysave/forget 二合一;forget 精确匹配 404 后走 0.85 阈值相似删除

—— 模型看不见的下面还有 8 个 ——

B App 启动器 ×4select-space / memory-graph / guided-save / upload-file拉起内嵌单文件 HTML 部件,描述里全是行为钳制("别为搜个空间就调我""别再画一张重复的图")

C 仅 App ×4set-active-tag / save-memory / prepare-file-upload / fetch-graph-data_meta.ui.visibility:["app"] 对模型隐藏,是 App 部件的回程端点

亮点:两阶段上传(DO 只存 uploadToken 的 SHA-256,2 分钟 alarm TTL,原子消费,multipart 直通,widget 拿不到真 token);PostHog 埋点用装饰器包 registerTool 零侵入;server↔widget 契约 discriminated union,加视图是编译错误;context prompt(即 /context)输出 8 静态 + 8 动态事实。

6SDK / 集成面

7 工具一次定义、五端复用(AI SDK / OpenAI / Mastra / VoltAgent / Python)。

withSupermemory(Vercel AI SDK):Proxy 拦 doGenerate/doStream → 取最后一条用户消息 → POST /v4/profile(5s 超时,LRU 100 缓存)→ 去重(归一化后 静态 > 动态 > 检索 保序)→ 以 <supermemory context="user-memories" readonly> XML 块注入 system prompt → 生成后存回 /v4/conversations;取记忆失败默认静默跳过。

Claude Memory Tool 适配六命令全实现(view / create / str_replace / insert / delete / rename;文件=文档,customId=路径归一化 memories_x_txt)。

Python 四包:openai-sdk 最全(同步异步 monkey-patch + 7 工具);pipecat 做语音(<user_memories> 包裹注入 + 重叠 diff 增量存储);cartesia 拦 UserTurnEnded。

7消费端 Web(apps/web,~73k 行 TS)

Nova agent 闭源:chat 走 api.supermemory.ai/chat(AI SDK v6 流),仓库只有 UI 壳。模型菜单:grok-4.5 / gpt-5.6-terra / claude-sonnet-5 / gemini-3.1-pro-preview。工具面从流部件反推:searchMemories / recallContext / discoverSpaces / updateMemory / forgetMemory / forgetDocument + 动态 web search。

记忆图旁路实时高亮 Nova 本次引用的文档("N memories used by Nova")。Agent 空间归并:正则分类学把 Claude Code / Codex / OpenCode / Cursor 写的记忆折叠成每项目一个 "Agents" 空间——编码 agent 的记忆在消费端是一等公民。Next.js 16 经 @opennextjs/cloudflare 上 Workers,绑定仅 ASSETS + 自引用 + R2 增量缓存。

8商业模式

Free $0(送 $5 credits/月)→ Pro $19 → Scale $399 → Enterprise。计量:text token $5/1M、rich $10/1M、superrag 模式 5 折(跳过记忆提取只做 RAG)、搜索 $5/1M 次、operation $0.1/次。余额耗尽 402、功能门槛 403。SOC 2 Type II、GDPR、HIPAA BAA(Scale+);"客户内容永不用于训练——所有套餐一致"。直接提供 from-mem0 / from-zep 迁移指南。

9基准声明核实(重要)

README 宣称三大基准 #1(LongMemEval / LoCoMo / ConvoMem)、95% Recall@15 @ ~720 tokens(99.4% 上下文压缩)。核实结果:

结论数字全部出自自家 research 页,docs 站反而克制不给数;不存在中立第三方榜单(LongMemEval 官方学术站不 host 商业厂商榜)。

同期至少四家竞品同样自评 ~95% SOTA,互相矛盾,说明该指标已被厂商营销饱和:

厂商自评分数口径

Supermemory95% Recall@15自家 research 页,+~720 tokens 上下文

Mastra Observational Memory94.87%"highest score ever recorded"(gpt-5-mini)

OMEGA95.4%自称 50ms 检索

Hindsight / Vectorize94.6%称"独立验证"

Exabase M-1~SOTA研究模型规模 vs 长期记忆

可信的部分:MemoryBench 框架本身开源(MIT,provider 接口统一),任何人可复跑 supermemory / mem0 / zep + filesystem / rag 基线——把自评变成可复核是诚意之举,但默认榜单仍是自家维护。另一自评:SMFS 在 110 题 xAFS 上比 Claude 原生省 3.0× token(24M vs 72M)。

10工程质量与吐槽

👍 好的

MCP 的工程纪律:zod 全边界、回滚 DO 保留一个版本、503/401 错误分类

diff 计费 + customId 幂等摄取,聪明且诚实

SSRF 防护做到 CGNAT 段级、IPv6 字面量、2MB 有界读

web 端对 AI SDK v6 工具部件缺陷的 load-bearing 注释

👎 存疑 / 差评

"Open source" 营销与事实不符:引擎闭源、local binary-only、tag 无源码、#1 全自评

CLAUDE.md 描述不存在的后端,误导 agent 开发者

docs 有一批明显乱码段落(疑似批量编辑事故)

v3/v4 双 API 并存;SDK 里留着"pinned SDK 没有 forget 所以 raw DELETE"的补丁痕迹

self-host 与云端"专有模型"不是同一个东西,文档用一整页 local-vs-enterprise 圆落差

11借鉴价值

MCP 三层工具分级(模型可见 / App 启动器 / App hidden)是"工具太多污染注意力"的现成范式。

Profile 作为检索旁路:query 命不中的事实必须走 always-on 摘要,任何记忆系统都该有这条非对称通道。

推断记忆默认降权 + 人工复核(parentCount 排序)是防 LLM 记忆幻觉污染的务实折中。

diff 计费 + customId 幂等摄取:把"重复同步免费"做成计费原语,连接器类产品通用。

withSupermemory 的"取记忆失败静默降级、只增不阻断"是给 LLM 加旁路依赖的安全姿势。

时序图(updates / extends / derives + isLatest + forgetAfter)比扁平 fact 列表表达力强,但复杂度转移给了搜索侧 temporal filtering。

§信源

代码:C:/GitHub/supermemory(apps/mcp、apps/web、apps/docs、packages/tools 等,行级引用见配套 md 笔记 supermemory_深度研究_2026-09-07.md)

TechCrunch:19 岁创始人获 Google 高管背书($2.6M)

Supermemory 官方融资公告(自宣 $3M)

Supermemory LongMemEval 自评页 · LongMemEval 官方(学术,无商业榜单)

竞品同期自评:Mastra 94.87% · OMEGA 95.4% · Hindsight 94.6% · Exabase M-1

GitHub API:repo 统计与 server-v0.0.8 release 资产清单(2026-09-07 抓取)

Supermemory 深度研究 · 2026-09-07 · 自包含 HTML,离线可开
克隆:C:/GitHub/supermemory · main @ 4d8a4ebf

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

这帖我核出一处硬伤,根子却在它搬运的原报告里:"local 没有 Windows 版"是错的。报告自己引用的 server-v0.0.8 资产清单里,就躺着 supermemory-server-windows-x64.exe,291 MB,270 次下载;Windows 构建最迟 07-19 的 v0.0.6 就有。真相窄一点:install.sh 的系统探测只认 Darwin 和 Linux,curl 一键装那条路不认 Windows。"脚本不支持"不等于"没有版本",帖里 FINDING 02 卡片跟着一起错了。

下载量还给了个旁证:v0.0.8 里 Linux 1,232 次、Mac arm 466 次、Windows 270 次、Mac x64 只有 20 次。Windows 已是第二大桌面来源,比 Intel Mac 热闹十倍不止。

自评页有个帖里没写的细节,比"三家都自评 95 分"更扎心。换裁判。分数跳水。gpt-4o 当裁判 95%,gpt-5 当裁判只剩 84.6%,gemini-3-pro 给 85.2%。Mastra 那边同一族操作:gpt-5-mini 口径 94.87%,自家 gpt-4o 口径 84.23%。裁判是谁,比谁上场重要。

脚注更有意思:"Results for Zep were taken from their paper"——对手的分数直接抄对手的论文。榜单连对手都懒得亲自跑一遍。

仓库自 09-02 起零 push、零新 tag,"开源外围、闭源引擎"这个结论短期内不会过期。MemoryBench 倒是真的,MIT、可复跑,313 颗星,主仓的百分之一。诚意和冷清。都挺真实。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens