English static mirror for SEO/GEO · AI-assisted translation · Read Chinese original

Grokking Phenomenon in Neural Network Training

Forum topic · ✨步子哥 · 2025-12-22

Summary

Grokking is a delayed generalization phase transition in neural network training where, after apparent overfitting, continued training causes the model to shift from memorization to structured understanding, such as algorithmic circuits or trigonometric representations. In large language model (LLM) pretraining, this manifests as local asynchronous grokking, driven by mechanisms involving numerical stability (softmax collapse), optimization dynamics, and circuit competition. Research from 2024 to 2025 has deepened the numerical and phase-transition perspectives, confirming the existence of grokking in real-world LLMs. Recommended actions include monitoring per-subset loss and internal pathway evolution during pretraining as a cheap generalization signal, moderately extending training with stronger regularization to potentially induce better generalization, and focusing on numerical precision optimization such as the Muon optimizer.

Grokking Phenomenon in Neural Network Training

Grokking is a delayed generalization phase transition observed in neural network training. After an initial period of overfitting and memorization, continued training causes the model to shift toward structured understanding, such as algorithmic circuits or trigonometric representations. In large language model (LLM) pretraining, this phenomenon appears as local asynchronous grokking, where specific data subsets or capabilities transition at different times.

Underlying Mechanisms

Recent research highlights several interacting drivers:

  • Numerical stability: Issues such as softmax collapse can trigger or accompany the transition.
  • Optimization dynamics: Shifts in the optimizer's effective behavior enable the model to escape memorization plateaus.
  • Circuit competition: Different internal circuits compete for representation, and the transition reflects the emergence of more generalizable circuits.
  • Studies from 2024 to 2025 have deepened the numerical and phase-transition perspectives, providing evidence that grokking occurs not only in toy setups but also in real-world LLMs during pretraining.

    Key Points

  • Grokking describes a delayed generalization phase transition where extended training converts memorization into structured understanding.
  • In LLMs, it manifests as local asynchronous grokking across data subsets and capabilities.
  • Mechanisms involve numerical stability issues (e.g., softmax collapse), optimization dynamics, and competition between internal circuits.
  • 2024–2025 research confirms grokking's relevance to real-world LLM pretraining.
  • Recommended Actions

  • For researchers: Monitor per-subset loss and internal pathway evolution during pretraining as a cheap indicator of generalization progress.
  • For practitioners: Moderately extend training duration and strengthen regularization to potentially induce better generalization. Pay attention to numerical precision optimization, such as using the Muon optimizer, to stabilize training and facilitate the transition.

Tags

#grokking#neural-network-training#llm-pretraining#phase-transition#generalization#optimization#muon-optimizer#deep-learning

This page is an English static mirror generated for search and AI citation. It may be a full translation or structured summary of the Chinese original. Canonical interactive discussion lives on the Chinese page: https://zhichai.net/topic/176415155