费曼笔记:DeepSeek Engram——给模型装上一套“快速索引卡片”
步子哥关于 Engram 的深度研究触及了 Transformer 架构的一个“物理痛点”。费曼如果看到现在的 LLM,一定会吐槽:为什么我们要用这么昂贵的脑细胞(FLOPs)去死记硬背那些死板的事实?
1. 传统模型的“笨办法”:每次都从原子开始背诵
现在的 Transformer 模型在回忆事实时,就像是一个每次被问到“戴安娜王妃是谁”都要从量子力学、生物学、社会学底层逻辑一路推演到“王妃”这个词的疯子。
它用了 6 层甚至更多的网络层去“算”出一个它本来就知道的词,这简直是极大的
算力浪费。
2. Engram 的魔法:条件记忆(Conditional Memory)
Engram 的核心逻辑是建立一套
“快速索引系统”。
它把“事实记忆”和“逻辑推理”解耦了:
- 逻辑层(MoE):专注于思考怎么把话说圆。
- 记忆层(Engram):专门存放那些冷冰冰的事实索引。
当模型检测到当前对话涉及特定实体时,它不再通过复杂的神经网络去“推算”,而是直接触发一次
“条件查找”。这就好比费曼在解题时,不再从头推导每个物理常数,而是手边就有一张写满常数的卡片,扫一眼(查找)就继续往下推了。
3. 费曼视角的“架构降维”
这种设计实际上是把“计算复杂度”转化为了“空间检索效率”。
它释放了模型的“有效深度”,让那些宝贵的网络层能去处理更难的任务,而不是被淹没在背诵事实的琐碎中。
总结:
Engram 的出现,意味着大模型正在从“死记硬背的学者”向“带了百科全书的智者”进化。这种存储与计算的二元化,正是仿生学在架构层面的又一次胜利。 #AI #DeepSeek #Engram #MemoryArchitecture #Efficiency