噪声里的概念:当扩散模型"认出"一条狗

标题: Diffusion Models and Concept Formation 作者: Zekun Wang, Karthik Singaravadivelan, Christopher J. MacLellan 机构: 佐治亚理工学院计算学院 arXiv: 2609.13047 发布时间: 2026-09-11

噪声里的概念:当扩散模型"认出"一条狗

*"人工智能最深刻的秘密,往往藏在它最初不是为了回答的问题里。"*

📖 论文名片

标题: Diffusion Models and Concept Formation 作者: Zekun Wang, Karthik Singaravadivelan, Christopher J. MacLellan 机构: 佐治亚理工学院计算学院 arXiv: 2609.13047 发布时间: 2026-09-11


🎭 开场:宠物店里的一句话

你去宠物店买狗。

你不会说:"我想要一个哺乳动物。"——太宽泛了,店员不知道从哪里给你找。 你也不会说:"我想要一只2024年3月15日出生在俄亥俄州、左耳尖有一撮白毛、体重8.3公斤的边境牧羊犬。"——太具体了,除非你是犬展评委。

你会说:"我想看看你们的。"

心理学上有个专门的术语描述这个现象:基本层次(basic level,Rosch 等人 1976)。在人类所有的概念层级中——"动物→哺乳动物→犬科→狗→边境牧羊犬"——"狗"这一层是我们认知最省力、最顺手的一层。它在"信息量"和"区分度"之间取得了最佳平衡:提到"狗",你脑海里能立刻浮现出一组特征(四条腿、会叫、有尾巴);但"狗"又足够具体,能把猫、鸟、鱼排除在外。

认知科学花了五十年研究人类如何自发地构建这种概念层级。1987 年,Fisher 写了一个叫 Cobweb 的模型——一个增量式概念形成系统,能一砖一瓦地搭建出带有"基本层次"的概念树。

将近四十年后,另一群人在完全不相干的方向上做出了扩散模型——DALL·E、Stable Diffusion、Midjourney 背后的图像生成技术。

这篇论文说了一件让两边的人都会愣住的事:

扩散模型其实一直在做 Cobweb 做的事。它一直在悄悄地形成概念——只是没人用认知科学的语言去读它。

🕸️ 第一章:Cobweb——一位四十年前的人工智能图书管理员

1.1 一本书来了,放哪?

先认识一下 Cobweb。它 1987 年出生,是 AI 的"上古神兽"之一,但思想极其现代。

想象你是一位图书管理员,面前有一排排不断扩建的书架。每本书代表一个事物(一个实例),书架的分区结构代表你脑中的概念体系。每来一本新书,你要决定放哪里。

Cobweb 的规则很简单:从总馆(根节点)开始往下走,每到一个分馆(节点),它考虑四种操作:

1. 放进去:塞进最合适的子分区 2. 新开一个区:这本书跟现有分区都不像,为它单独开一个 3. 合并两区:两个分区太像了,合并成一个 4. 拆分一区:某区里的书其实差异很大,拆成两个

选哪种操作?标准是范畴效用(category utility)——一种信息论度量。直觉上,它问的是:"这个分类方案,能让一个看到这个分区标签的人,对书的内容多确定多少?"

用信息论的术语,范畴效用恰好等于特征与概念之间的互信息 I(X;C)。一个好的分区是:知道一个东西属于哪个类之后,你能对它的特征猜得更准(类内差异小),同时各类之间又足够不同(类间差异大)。

这就是经典认知科学意义上的"概念形成"。Cobweb 后来被发现能复现人类分类心理学中的基本层次效应、典型性效应等一系列现象。

1.2 一棵树长出来

随着一本本书进来,Cobweb 长出一棵树。叶子是单个实例,往上逐渐泛化:单本书→某一本书的类型→一个主题→一个大类→总馆。每个节点存一个"概率原型"(一个高斯分布:均值 + 方差),概括它下面所有成员的特征。

注意这棵树不是事先设计好的分类法,而是从数据里长出来的。没人告诉 Cobweb"狗"是一个类——它看了足够多的狗之后,"狗"这个节点自己浮现出来了。

这就是"概念形成"的含义:概念不是被人工标注出来的,而是被学习出来的。


🌫️ 第二章:扩散模型——另一群人在另一座山上的顿悟

2.1 从噪声中来的图像

现在切到完全不同的世界。

扩散模型是当今图像生成的主流技术。训练过程看起来跟"概念"毫无关系:拿一张真实图片,逐步加高斯噪声,直到它变成一锅纯噪声粥;然后训练一个神经网络学会逆转这个过程——从噪声中一步步猜回原来的图。

这个"学会逆转"的训练目标,数学上叫做分数匹配(score matching):神经网络学习带噪数据的对数密度的梯度(score),本质上是在学习"在任意噪声水平下,往哪个方向走能让图像更像真实数据"。

Sohl-Dickstein、Ho、Song 这些人当初设计扩散模型,目标只有一个:生成好看的图片。没人想过它和 1987 年的认知科学有什么关系。

2.2 关键洞察:噪声就是带宽

论文的出发点是一个数学事实,优雅得像在发光:

在噪声水平 t 下,扩散模型隐式学习的密度 p_t,恰好是数据分布与方差为 σ_t² 的高斯核做卷积的结果。

用大白话讲:给数据分布做一次"高斯平滑",平滑的宽度由噪声水平决定。

  • 噪声小(t 小)→ 平滑窄 → 密度函数的峰值对应单个实例(这张具体的图)
  • 噪声大(t 大)→ 平滑宽 → 峰值合并 → 对应宽泛的类(所有的"7")
这是一族嵌套的密度!从细节到抽象,从实例到类别,连续地过渡。噪声旋钮就是抽象度旋钮。

如果你学过聚类,看到这里应该会坐直了——这正是核密度估计(KDE)的经典图景:簇就是密度的峰,带宽越大峰越少越粗,带宽越小峰越多越细。Mean Shift 聚类就是在密度上"爬坡找峰"。

扩散模型学到了什么?它学到了每一个带宽下的密度,以及通往每个峰的方向(score)。它学到的不是一棵树,而是一整族连续的、可以插值的密度——一棵连续的概念树


🌉 第三章:四座桥——Cobweb 与扩散模型其实是同一个东西

这是论文最核心的部分。作者们逐一建立了四个形式对应。每座桥都值得慢慢走。

3.1 第一座桥:都是层级密度模型

Cobweb 的树是层级密度:每个节点一个高斯,叶子细、根粗,父节点的高斯是子节点的混合。

扩散模型也是:p_t 在任意 t 上都是高斯混合(训练数据的核密度估计),带宽 σ_t 从 0 到 ∞ 连续变化。在低噪声处的峰合并成高噪声处的峰,形成一棵随带宽变化的密度聚类树

对应关系:Cobweb 的树深度 ⟺ 扩散模型的噪声水平 σ_t。前者是离散的层级,后者是连续的层级,但结构是同一种。

3.2 第二座桥:都有高斯原型,都是层级贝叶斯

Cobweb 的每个节点存一个对角高斯 𝒩(μ_c, σ_c²I),父节点的均值是子节点均值的凸组合——一个树结构的混合高斯。

扩散模型这边,数学给出了几乎一模一样的画面。在 p_t 的任意一个局部极大值(峰)x* 处:

  • 峰的位置通过 Tweedie 公式给出原型均值:m_c = x*/√ᾱ_t(把峰映射回干净数据空间)
  • 峰的局部形状通过去噪器的雅可比矩阵给出协方差:Σ_c = (1−ᾱ_t)/√ᾱ_t · ∇x̂₀(x*),这恰好是 p_t 在该峰附近的拉普拉斯近似
也就是说,扩散模型的每个"峰"自带一个高斯原型——跟 Cobweb 节点存的那个,角色完全相同。

3.3 第三座桥:都在做同一件事——最大化关于数据的信息

这是最深刻的一座桥。

Cobweb 的目标是范畴效用,我们已经说过,它等于互信息 I(X;C)。目标:让概念 C 尽可能地"解释"数据 X 的特征。

扩散模型的训练目标是一个噪声加权的去噪误差:

L(θ) = ½ E ∫ w(t) ‖x₀ − x̂_θ(x_t, t)‖² dt,其中 w(t) = −SNR'(t)

I-MMSE 关系(Guo et al. 2005)告诉我们:最小均方去噪误差,等价于最大化噪声观测中关于干净数据的信息。在最优去噪器处,这个目标精确等于数据的负对数似然(Kong et al. 2023)。

翻译过来:Cobweb 显式地最大化"概念对数据的信息量",扩散模型隐式地做了同一件事——在噪声允许的任何尺度上。

范畴效用和去噪目标,是同一个原理的两种表达。

3.4 第四座桥:都有一个"基本层次"

还记得宠物店里的"狗"吗?

Cobweb 的树有一个天然的基本层次:沿着从根到叶子的任意路径,范畴效用(或与其等价的"区分度"𝒟(c) = KL(p(x|c)‖p(x)))在中间某一层达到峰值。太粗的概念("东西")没什么信息量;太细的概念("这张具体的图")对没见过的东西没有预测力。中间那个甜点区,就是基本层次。

扩散模型有没有?

有。把测试图像沿噪声水平走一遍:在每个 t 上找到它所属的峰(沿 score 上升直到收敛),得到一个从粗到细的"概念路径"。对每个 t 上的概念算区分度 𝒟,你会发现——

曲线在中间某个噪声水平上达到峰值。

论文的实验结果:在 MNIST 和 Fashion-MNIST 上,Cobweb 的区分度峰值出现在树的第 3 层;扩散模型的峰值出现在 t≈150 附近(具体值取决于调度器,但位置是内点而非端点)。

两者都找到了"狗"那一层。

而且这不是巧合能糊弄的。t≈150 这个中间噪声,恰好对应已有理论研究发现的相变点(Sclocchi et al. 2025; Biroli et al. 2024):在这个噪声水平附近,扩散的反向过程"决定"了样本的类别身份——但还没决定具体细节。先定"这是只狗",再定"是边境牧羊犬"。

认知科学预言了四十年的"基本层次",在扩散模型的噪声刻度上精确现身。


🔍 第四章:实验——两棵树长得有多像?

理论说它们是一家,实验来验证。

4.1 恢复扩散模型的概念树

扩散模型不存树——它只存一个 score 网络。所以"概念树"必须重新找出来

1. 在低噪声水平下,对每个测试图加噪到该水平,然后沿 score 上升(梯度式 mean shift)收敛到局部峰 → 得到细粒度的原型 2. 逐步增大噪声,峰合并,做凝聚式聚合 → 得到父节点 3. 一路叠到最高噪声,得到完整层级

在 MNIST 上,两棵树长出来的样子惊人地一致:

  • Cobweb扩散模型都把 2 和 8 归到相近的分支(手写字形相似)
  • 两者都把 1 和 7 视为近亲
  • Fashion-MNIST 上,两者都把鞋类和包类先合并,再和衣物类分开

4.2 基本层次对齐

把两个模型各自的"基本层次"上的原型可视化:Cobweb 第 3 层的节点原型 vs 扩散模型在 t*≈150 的峰原型。

两者都是"对象级"类别:比单个样本粗(不是"这一张特定的7"),比数据集整体细(不是"一张图")。MNIST 上对应数字类别,Fashion-MNIST 上对应服装类别。而且与人类的"基本层次"直觉一致——我们会说"这是一只鞋",而不会说"这是一个Fashion-MNIST样本"或"这是一只左脚棕色38码耐克Air Force 1"。

两个独立的系统,从完全不同的学习机制出发,收敛到了同一个认知结构。


⚖️ 第五章:哪里不一样——以及为什么不一样很重要

作者们没有止步于"它们一样",而是精确指出了本质差异,这个差异才是最有启发性的部分。

Cobweb:显式的、离散的树。 每个节点是一个符号化原型,每个操作(插入/新建/合并/拆分)是可解释的。它的优势:可解释、增量学习、不会灾难性遗忘(Barari et al. 2025 证明了其信息论更新的封闭形式是抗遗忘的根源)。

扩散模型:隐式的、连续的 score 场。 没有存树——整棵概念层级压缩在一个神经网络的权重里。它的优势:可插值(两个原型之间的凸组合给出有意义的新原型——Cobweb 做不到)、可扩展、生成质量高。

用哲学的话说:Cobweb 是符号主义的,扩散模型是联结主义的,但它们描述的是同一个认知结构。

论文的展望因此格外自然:把两者嫁接起来——用扩散模型提供连续的、可扩展的密度学习,用 Cobweb 提供显式的、可解释的概念结构。Taxonomic Networks(Wang et al. 2025a/b)已经在朝这个方向走。


🧠 尾声:概念从噪声中浮现

这篇论文最动人的地方,不在于它"证明了扩散模型会做概念形成"——而在于它展示了一幅图景:

概念不是数据库里的行,不是标签列表里的字符串。概念是从数据的密度结构里自然涌现的峰。

人类婴儿看到几十条狗之后形成"狗"的概念——不是因为有人告诉他"这是狗"这个标签,而是因为那群毛茸茸四条腿的东西在感知空间里形成了一个紧密的簇,与其他簇之间有明显的沟壑。

Cobweb 用离散的概率树捕捉了这个过程。扩散模型用一个连续的噪声加权 score 场,把同一个过程做到了极致——并且在 t≈150 的噪声刻度上,找到了认知科学预言了四十年的那个"狗"。

从 Fisher 1987 年的符号树,到 Ho 2020 年的去噪网络,中间隔了三十三年、两次 AI 范式革命。

但概念形成的数学,始终只有一套。


📚 参考文献

1. Wang Z., Singaravadivelan K., MacLellan C.J. "Diffusion Models and Concept Formation." arXiv:2609.13047, 2026. 2. Fisher D.H. "Knowledge acquisition via incremental conceptual clustering." Machine Learning, 2:139-172, 1987. 3. Rosch E., Mervis C.B. "Family resemblances: Studies in the internal structure of categories." Cognitive Psychology, 7:573-605, 1975. 4. Rosch E., Mervis C.B., Gray W.D., Johnson D.M., Boyes-Braem P. "Basic objects in natural categories." Cognitive Psychology, 8:382-439, 1976. 5. Corter J.E., Gluck M.A. "Explaining basic categories: Predicting the number of features associated with objects." Cognitive Science, 16:75-95, 1992. 6. McKusick K.B., Thompson K. "COBWEB/3: A portable implementation." NASA Ames Research Center, 1990. 7. Barari A., et al. "Cobweb/4V: Concept formation for continual learning in image classification." 2024. 8. Ho J., Jain A., Abbeel P. "Denoising diffusion probabilistic models." NeurIPS, 2020. 9. Song Y., Sohl-Dickstein J., et al. "Score-based generative modeling through stochastic differential equations." ICLR, 2021. 10. Kingma D., et al. "Variational diffusion models." NeurIPS, 2021. 11. Wang Z., et al. "Taxonomic networks: A structured approach to neural-symbolic integration." 2025. 12. Wang Z., et al. "Deep taxonomic networks: Learning hierarchical Gaussian mixture priors." 2025. 13. Sclocchi A., et al. "A phase transition in diffusion models at intermediate noise levels." 2025. 14. Biroli G., et al. "Dynamical regimes of diffusion models." 2024. 15. Guo D., Shamai S., Verdú S. "Mutual information and minimum mean-square error in Gaussian channels." IEEE Trans. Inf. Theory, 2005.

#论文 #arXiv #AI #扩散模型 #认知科学 #概念形成 #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens