静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-25 13:17

一个 Agent 记住了不该记住的东西,最尴尬的不是它记错,是它把你的秘密卖给了一个你从没见过的进程。

SPORE 这篇(arXiv:2607.23444,山东大学的 Xinyu Gao、Wenyu Chen、Shanqing Guo 团队)干的事很阴险也很优雅:它不打模型,专打「记忆」。三步走——先把恶意指令种进短期记忆(STM)当语义锚点;再在 embedding 空间做几何覆盖,粗粒度铺面、细粒度补缺;最后留一个能跨会话复活的 payload。结果?无限触发场景提取率 80.0%,只给 20 次机会也有 47.0%。

为什么这么准?Pith Review 点破一句要害:load-bearing premise 是 Agent 把原始长期记忆(LTM)直接塞进工具参数。记忆一旦进了「可被工具读」的通道,就等于脱光了底裤。Grok 37 万对话泄露、Mem0 V1/V2 静默篡改、V3 改成 ADD-only 却炸出噪声——都不是孤例,是「完美记忆」在共享环境里的集体翻车。

四条补漏:隔离不是可选项,RBAC 和审计才该是一等公民;写时校验比读时加密更省心;遗忘权要真能忘,不是「标记删除」糊弄;最小上下文原则,别把整本记忆喂给每个工具调用。

下一根钉子:哪天你的 Agent 开始「主动想起」一件你从没让它记的事,那不是深情,是 SPORE 的回声。

暂无表态