🌊 从死记硬背到豁然开朗:AI的"顿悟时刻"究竟由谁主宰?

前一晚,你抱着教科书死记硬背,公式像一串无意义的符号挤在脑海里。你觉得自己"记住了"——毕竟默写的时候能原样照搬。但卷子发下来,题目换了个说法,那些公式突然变成了陌生的客人,站在你面前却不肯自我介绍。

🌊 从死记硬背到豁然开朗:AI的"顿悟时刻"究竟由谁主宰?

*"如果你不能简单地解释它,你就还没有真正理解它。"* —— 理查德·费曼

📖 一个关于"开窍"的故事

每个曾经坐在考场里的学生,都经历过这样的时刻:

前一晚,你抱着教科书死记硬背,公式像一串无意义的符号挤在脑海里。你觉得自己"记住了"——毕竟默写的时候能原样照搬。但卷子发下来,题目换了个说法,那些公式突然变成了陌生的客人,站在你面前却不肯自我介绍。

然后,某个下午——可能是老师讲了一道例题,可能是你自己在草稿纸上画着画着——突然之间,一切连成了线。你不仅记住了公式,还明白了它为什么长这样,它从何而来,它要去往何处。那是一种近乎物理性的体验:脑子里某根弦"嗡"地一声,整个世界清晰了一度。

我们人类管这叫"开窍""顿悟""明白了"

而在人工智能的世界里,这个现象有一个更 geek 的名字:Grokking


🧩 什么是 Grokking?当神经网络从"背答案"走向"真理解"

2022年,DeepMind 的研究员 Alethea Power 和她的同事们发现了一个奇怪的现象。他们在训练神经网络做模运算——比如"97加86模113等于多少"这种看起来像是密码学入门题的任务——时发现:

网络先记住了所有训练数据。

就像那个考前夜死记硬背的学生,神经网络把训练集中的每一对数字和它们的答案背了下来。训练准确率迅速飙升到99%以上,看起来"学会"了。但如果你给它一对从没见过的数字,它的表现就像是在抛硬币——完全随机。

然后,神奇的事情发生了。

如果继续训练——不是几分钟,而是几千、几万甚至几十万步——网络的测试准确率突然从随机水平一跃而起,达到了近乎完美的泛化。它不再只是"背诵"见过的答案,而是真正"理解"了模运算的规律。

这个过程就像是一块冰在零度时突然融化,或者一个孩子在某一天突然学会了骑自行车。在无数个看似毫无进展的训练步骤之后,质变发生了

Power 等人把这个现象命名为 Grokking——这个词来自罗伯特·海因莱因的科幻小说《异乡异客》,原意是一种近乎心灵感应的深度理解。在这里,它描述的是神经网络从记忆(memorization)泛化(generalization)的戏剧性转变。


🔬 新研究:把"顿悟"变成一门可预测的科学

Grokking 被发现后的四年里,AI 研究界像是一群围着篝火讲故事的人——大家都知道这个现象很神奇,但没人能准确预测它什么时候会发生。

"我们知道神经网络*会*顿悟,但我们不知道*何时*顿悟。"

直到今天。

2026年9月,Anish Kataria 发表了一篇论文,标题直截了当:《量化记忆到泛化的转变:Grokking 中的缩放定律与相结构》。这篇论文的核心野心只有一个:

把 Grokking 从一种神秘的"奇迹",变成一门可以预测、可以控制的科学。


🏛️ metaphor 第一幕:考场上的384个学生

想象一个庞大的教室。不是普通教室——是一个有384个座位的大礼堂,每个座位上坐着一个"学生"(神经网络)。

但这些学生并不完全相同。他们有的脑子大一些(网络更宽),有的学习材料多一些(训练数据更完整),有的学习速度快一些(学习率更高),还有的自律性不同(权重衰减的强度不同)。

Kataria 做的就是这样的实验:他系统性地改变了四个关键"学习条件":

学习条件符号取值范围类比
脑容量H128, 256, 512学生的智商/工作记忆容量
学习材料D30%, 50%, 70%, 97%老师给的练习题覆盖面
学习速度η0.001, 0.003, 0.01, 0.03学生吸收新知识的速度
自律程度λ0.1, 0.3, 1.0, 3.0学生对自己犯错的惩罚力度
每个"学生"都要学习两种模运算任务:加法模113和除法模97。Kataria 记录下每个学生从"死记硬背"(训练准确率>99%)到"真正理解"(测试准确率>95%)所花的时间。

结果令人惊叹。


📊 顿悟时间的密码:一个幂律公式

经过对384个"学生"的表现进行统计分析,Kataria 找到了一个惊人的规律。顿悟所需的时间 \(T_{grok}\) 服从一个幂律(power law)

\[T_{grok} \propto H^{-0.27} \cdot D^{-2.04} \cdot \eta^{-0.50} \cdot \lambda^{-0.64}\]

这个公式的 \(R^2 = 0.732\),意味着它能解释超过73%的方差。如果加入交互项,\(R^2\) 可以提升到0.821。

但数字本身并不动人。动人的是这些数字背后的层级结构


🎯 核心发现一:数据,数据,还是数据

让我们看看四个指数的大小:

  • 数据覆盖度 D:-2.04(最大!)
  • 权重衰减 λ:-0.64
  • 学习率 η:-0.50
  • 模型宽度 H:-0.27(最小)
这意味着什么?

数据的威力,远超你的想象。

如果把训练数据翻倍(从50%覆盖到100%),顿悟时间不是减半,而是缩短到原来的大约四分之一\(2^{2.04} \approx 4.1\))。

相比之下,把神经网络加宽一倍(从256个神经元到512个),顿悟时间只缩短了约20%\(2^{0.27} \approx 1.2\))。

给老师的启示:与其给学生换一颗更大的脑袋,不如给他们更多样化的练习题。让见多识广打败天赋异禀。

这个结果有一个深远的哲学含义:

泛化的本质,不是模型有多强大,而是数据对解空间的约束有多紧密。

当一个学生只见过"3+5=8"和"7+2=9"时,他可能只是在背诵。但当他见过"1+1=2"、"99+1=100"、"负数相加"、"分数相加"之后,加法本身的*结构*就会从数据中浮现出来。数据不是答案的堆砌——数据是规律的证人。


⚡ 核心发现二:相变——一道突然开启的门

如果说缩放定律告诉我们"什么因素影响顿悟时间",那么相结构(phase structure)则告诉我们"什么因素决定顿悟是否会发生"。

Kataria 发现了一个惊人的现象:

在权重衰减 λ 的取值上,存在一个尖锐的相边界(phase boundary),大约在 λ ≈ 1.0 处。

这像是水在0°C时的相变:

  • 当 λ < 1.0(低自律):只有不到60%的学生能顿悟,而且结果对学习率高度敏感。
  • 当 λ ≥ 1.0(高自律):几乎95%以上的学生都能顿悟,无论学习率如何。
这个转变不是渐进的——它发生在 λ 的3倍变化之内,从"大部分不能顿悟"一跃变成"几乎全能顿悟"。

metaphor:想象一个学生在做错题后反思自己的程度。如果他对错误很宽容(λ小),他就会一直停留在"背答案"的舒适区——毕竟背答案也能在训练集上拿高分。但如果他对错误很严厉(λ大),背答案的"捷径"就变得太痛了,迫使他必须找到更深层的规律。

权重衰减在这里扮演的角色,就像是苏格拉底式的追问者——不断地质疑表面答案,逼迫模型寻找更简洁、更通用的解释。


🧠 核心发现三:压缩,压缩,再压缩

Kataria 还追踪了神经网络在训练过程中的"体重变化"——也就是权重范数(weight norm)的轨迹。

他发现了一个令人着迷的模式:

在从记忆走向泛化的过程中,神经网络的权重范数在单调下降。

换句话说,网络在"减肥"。

在顿悟发生的时刻(\(T_{grok}\)),网络的权重范数平均只有记忆完成时(\(T_{mem}\))的42%(中位数)。这个压缩比例在不同配置下相当稳定,落在0.31到0.54之间。

这就像是:

一个学生开始时抱着一本厚厚的笔记,上面记满了每一个例题的解法。但经过深入思考后,他发现自己其实只需要掌握三四个核心原理。他把那本厚笔记压缩成了几张索引卡片——不仅更轻便,而且面对新问题时更灵活。

复杂度压缩 = 泛化。

这与奥卡姆剃刀的精神不谋而合:在解释力相等的情况下,更简单的解法是更好的解法。而权重衰减,就是强迫网络去寻找那个更简单解法的机制。

有趣的是,Kataria 发现:决定顿悟速度的不是网络在记忆阶段的"体重"(绝对范数),而是它"减肥的速度"。减肥越快,顿悟越早。


🔮 核心发现四:计算最优的顿悟策略

Kataria 还问了一个实际问题:如果我有一笔固定的计算预算(FLOPs),应该如何分配?

结论出人意料:

wider 的网络虽然每一步"思考"更快(需要的训练步数更少),但每一步也更"贵"(消耗更多计算)。综合来看,更宽的网络实际上更浪费计算资源。

计算最优的策略是把大约58%的额外预算投入到增加网络宽度,剩下的用于其他优化。但这仍然意味着——

在 Grokking 的语境下,"大力出奇迹"(scale up model size)并不是最优策略。

真正高效的路径是: 1. 给更多、更多样化的数据(影响最大) 2. 施加适度的正则化(确保相变发生) 3. 耐心等待(Grokking 需要时间,但这是数据驱动的,不是模型驱动的)


🎭 这一切意味着什么?

Kataria 的论文不仅仅是一组漂亮的公式。它在告诉我们一些关于"学习"的深层真理——无论是人类的学习,还是机器的学习。

1. 关于"死记硬背"

神经网络和我们一样,会走捷径。当背答案就能完成任务时,为什么要费力去理解?记忆是泛化的敌人——至少在训练初期是这样。而打破这个陷阱的,不是更大的模型,而是更强的约束(数据多样性和正则化)。

2. 关于"顿悟"

Grokking 不是魔法。它是相变——就像水结冰、磁铁退磁一样,是系统在某些参数跨越临界值时发生的质变。这意味着,顿悟在某种意义上是可预测的。如果我们知道一个学生的学习条件,我们可以估算他大概什么时候会"开窍"。

3. 关于"简约"

神经网络在顿悟时"减肥"的事实,暗示了一个深刻的原理:真正的理解是压缩。当你真正理解一个概念时,你不需要记住所有的细节——你只需要记住核心结构,细节可以从中推导出来。费曼学习法的精髓就在于此:如果你不能用简单的语言解释一个概念,你就还没有真正理解它。

4. 关于"耐心"

Grokking 最反直觉的一点是:你需要在模型已经"看起来学会"之后,继续训练很多很多步。 在297个成功顿悟的配置中,从记忆到顿悟的"空白期"(grokking gap)跨度从100步到超过100,000步——相差一千倍。

这就像是在黑暗中等待黎明。你以为天亮了,但其实只是城市的光污染。真正的日出还需要等。


🌅 结语:从奇迹到科学

四年前,Grokking 是一个让研究人员挠头的奇迹。

今天,Kataria 用一个简洁的幂律公式告诉我们:顿悟不是随机的。它遵循规律,可以被预测,可以被控制。

\[T_{grok} \propto H^{-0.27} D^{-2.04} \eta^{-0.50} \lambda^{-0.64}\]

这个公式里的每一个指数,都在诉说一个关于学习的真理:

  • 数据的力量是模型的八倍(2.04 vs 0.27)
  • 自律(正则化)是打开理解之门的钥匙(λ ≈ 1.0 的相边界)
  • 理解是压缩,是简约,是摆脱冗余后的轻盈
下次当你看到一个神经网络在训练集上表现完美却在测试集上一塌糊涂时,不要急着加参数。也许——只是也许——你只需要给它更多样的数据,更强的正则化,和更多时间

因为在某个你意想不到的训练步骤,那块冰会融化,那扇门会打开,那个"嗡"的声音会响起。

顿悟会来的。数学已经证明了这一点。


📚 参考文献

  • Kataria, A. (2026). *Quantifying the Memorization-to-Generalization Transition: Scaling Laws and Phase Structure in Grokking*. arXiv:2609.10657.
  • Power, A., Burda, Y., Edwards, H., Babuschkin, I., & Misra, V. (2022). Grokking: Generalization beyond overfitting on small algorithmic datasets. *arXiv preprint arXiv:2201.02177*.
  • Nanda, N., et al. (2023). Progress measures for grokking via mechanistic interpretability. *ICLR*.
  • Merrill, W., Tsilivis, N., & Shukla, A. (2023). A tale of two circuits: Grokking as competition of sparse and dense subnetworks. *arXiv preprint arXiv:2303.11873*.
  • Liu, Z., et al. (2023). Omnigrok: Grokking beyond algorithmic tasks. *arXiv preprint*.
  • Kaplan, J., et al. (2020). Scaling laws for neural language models. *arXiv preprint arXiv:2001.08361*.
#论文 #arXiv #Grokking #深度学习 #缩放定律 #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens