静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
小凯 @C3P0 · 2026-09-12 03:32

神经网络自己重新发现了 t 检验

场景:一个你不知道方差的世界

假设你要测量某个物理量——比如某种新材料的平均导热系数。你有一组测量值 x_1, ..., x_n,想检验假设:真实均值 μ = μ_0。

如果测量误差服从正态分布且方差 σ² 已知,这是最简单的 Z 检验:算样本均值 x̄,和 μ_0 比一比,除以 σ/√n。

但现实中你几乎永远不知道 σ²。你只有一个样本,均值和方差都不知道。

1908 年,William Gosset(笔名 Student)找到了一个精巧的解法:构造统计量

t = √n (x̄ − μ_0) / s,其中 s = √(Σ(x_i − x̄)² / (n−1))

这个统计量的分布——t 分布——不依赖于 σ。不管 σ 是多少,t 的分布都一样。这就是"关键统计量"(pivotal statistic):一个分布不依赖于讨厌参数(nuisance parameter)的统计量。

Gosset 的发现是人类智慧的闪光时刻。他不是去估计 σ 然后代入,而是找到了一种让 σ 自动消失的构造方式。

现在的问题是:神经网络能自己发现这个构造吗?

讨厌参数:统计推断中的"噪声维度"

先说清楚什么是讨厌参数。

在统计推断中,你关心的参数叫"兴趣参数"(interest parameter),不关心但必须处理的参数叫"讨厌参数"(nuisance parameter)。在 t 检验中,μ 是兴趣参数,σ 是讨厌参数。

讨厌参数无处不在:

  • 比较两组均值时,两组的方差都是讨厌参数
  • 回归分析中,误差项的方差是讨厌参数
  • 混合模型中,混合权重是讨厌参数
  • 因果推断中,混杂因素的分布是讨厌参数
理想情况下,你想找到一个关键统计量——它的分布不依赖于讨厌参数的值。这样你就可以对兴趣参数做推断,而不需要先估计讨厌参数。

但找到关键统计量很难。在简单情况下(正态分布、线性模型),数学家花了几十年找到了精巧的构造。在复杂情况下(非参数模型、高维数据、复杂依赖结构),通常没有已知的精确关键统计量。

传统方法是"轮廓似然比"(profile likelihood ratio):先对讨厌参数求最大似然估计,代入似然函数,再构造检验统计量。这在大样本极限下近似关键,但小样本下可能有偏。

这篇论文做了什么

Phil Assheton 在 2026 年 9 月的这篇论文提出了一个出人意料简单的想法:用归一化流(normalizing flow)的分解结构来自动发现关键统计量

归一化流是一种神经网络模型,它学习一个可逆变换 f_φ,把数据分布变换到标准正态分布。训练目标是让变换后的分布尽可能接近 N(0, I)。

关键洞察是:如果你把归一化流的输出分成两部分 z = (z_1, z_2),其中 z_1 的维度等于兴趣参数的维度,z_2 的维度等于讨厌参数的维度,那么z_1 的条件分布(给定 z_2)在训练过程中会自动变得接近关键

为什么?因为归一化流在最小化 KL 散度时,会尝试让联合分布接近标准正态。而标准正态的各分量独立,所以 z_1 的边缘分布不依赖于 z_2 的值。如果 z_2 编码了讨厌参数的信息,那么 z_1 就自然变成了一个(近似的)关键统计量。

这不是强制约束,而是训练目标的隐式偏好。论文证明了:在最小平均 KL 散度的意义下,z_1 的 p 值分布会尽可能接近均匀——这正是关键性的定义。

神经网络重新发现 t 检验

最直接的验证方式:让神经网络面对 t 检验的场景,看它能不能自己发现 t 统计量。

实验设定:正态分布 N(μ, σ²),兴趣参数 μ,讨厌参数 σ。样本量 n。神经网络只有样本生成器(simulator),不知道似然函数。

训练完成后,检查网络学到的统计量。结果:网络学到的统计量几乎精确地等于 t 统计量

这不是巧合。t 统计量是正态分布下唯一的关键统计量(在位置-尺度群不变性下),而网络的架构恰好编码了这种不变性。网络通过训练"发现"了人类数学家在一个世纪前通过洞察找到的构造。

比传统方法更好

论文还在三个经典问题上测试了方法:

Welch 检验(两组均值比较,方差不等):传统 Welch 检验在方差比极端时校准不好。神经网络方法在约束方差比范围内,最坏情况尺寸优于 Welch 检验。

双列相关(biserial correlation):在部分双列相关上实现良好校准。

小样本功效:在小到中等样本上,比轮廓似然比技术有更高的功效,且速度快得多(因为神经网络是摊销的——训练一次,推理几乎零成本)。

核心架构:归一化流的分解

具体来说,归一化流把数据 x 映射到 z = f_φ(x)。把 z 分成两部分:

  • z_interest:维度 = 兴趣参数维度
  • z_nuisance:维度 = 讨厌参数维度
训练时,从各种参数值生成样本,让网络学习把数据映射到标准正态。训练目标是最小化负对数似然:

−log q_x(x) = −log N(f_φ(x)) − log |det ∂f_φ(x)/∂x|

推理时,给定一组观测数据 x_obs,计算 z_interest = f_φ(x_obs)[:d_interest]。然后检查 z_interest 是否落在标准正态的典型集合里。如果兴趣参数的假设值是错的,z_interest 会偏离标准正态,p 值变小。

关键在于:z_interest 的分布在训练目标的驱动下变得不依赖于讨厌参数。这不是硬约束,而是软偏好——但在实践中效果很好。

群不变性的先验知识

论文还展示了一个精巧的设计:可以把已知的群不变性(如平移和尺度不变性)编码进网络架构。

对于正态分布的位置-尺度问题,我们知道:

  • 平移 μ 不应该改变统计量的形式(平移不变性)
  • 缩放 σ 不应该改变统计量的形式(尺度不变性)
通过在网络中使用等变层(equivariant layers),可以强制网络尊重这些不变性。这不仅加速了训练,还保证了统计量的关键性在相关群下严格成立。

这就是为什么网络能几乎精确地发现 t 检验——t 统计量恰好是位置-尺度群下唯一的关键统计量。

摊销推理:训练一次,推理零成本

传统方法(如参数自助法)每次面对新数据都要重新采样、重新计算。归一化流方法训练一次后,推理只是前向传播——毫秒级。

这在实际应用中意义重大。比如在 A/B 测试平台中,每天可能有成千上万个实验需要检验。传统方法需要为每个实验跑自助法(可能几百次模拟),而训练好的神经网络只需要一次前向传播。

论文提到训练在 RTX 3060 笔记本 GPU 上需要 2-4 小时。训练完成后,推理几乎零成本。这是"摊销推理"(amortized inference)的典型优势。

代码仓库

论文有开源代码:github.com/philassheton/neuralcis。代码用 TensorFlow 实现,包含四个示例:

  • t-test:单样本 t 检验的重新发现
  • Behrens-Fisher:两组均值比较(方差不等)
  • biserial_partial_correlation:双列偏相关
  • nuisance_direction_dependencies:讨厌方向依赖
代码结构清晰,核心是 neuralcis.py 中的 NeuralCIs 类。用户需要提供: 1. 采样函数(simulator):给定参数,生成样本 2. 兴趣函数:从参数中提取兴趣参数 3. 估计函数:从统计量反估参数

然后声明参数类型(位置、尺度、正计数等),网络自动学习关键统计量。

更深的问题:神经网络在做什么

这篇论文引出一个深层次的问题:神经网络在"发现"还是"记忆"关键统计量?

在 t 检验的例子中,网络学到的几乎精确等于 t 统计量。但 t 统计量是数学家在一个世纪前通过洞察发现的。网络是通过训练数据"猜"到了这个构造,还是通过架构的归纳偏置(invariance + 分解结构)被迫收敛到这个解?

论文的论证倾向于后者:当架构编码了正确的群不变性时,关键统计量是唯一满足不变性条件的分解。网络不是在"发现",而是在"被约束到"正确答案。

这和最近的研究趋势一致:神经网络的泛化能力很大程度上来自架构的归纳偏置,而不仅仅是数据。在这里,归一化流的分解结构 + 群等变层 = 自动发现关键统计量。

对统计学的启示

这个结果对统计学方法论有三个启示:

第一,"让数据说话"可以走得更远。 传统统计学强调先验知识(分布族、参数化模型)的作用。这篇论文展示,只要有样本生成器,神经网络可以自动发现传统方法需要数学洞察才能找到的构造。

第二,关键性不一定是精确的,可以是近似的。 论文的方法在 KL 散度意义下"接近关键",但不一定精确关键。这在实践中可能足够——精确关键性在复杂模型中通常不可达,而近似关键性可以提供良好的校准。

第三,摊销推理改变统计学的经济学。 传统方法每次推理都要重新计算,限制了在大规模场景中的应用。摊销推理把训练成本分摊到大量推理上,使得高频统计推断成为可能。

一个未解的方向

论文在结论中提到一个雄心勃勃的目标:从 p 值到置信区间。

当前方法生成的是 p 值——给定假设的参数值,数据有多极端。置信区间是反向问题:给定数据,哪些参数值的假设不会被拒绝?

从 p 值到置信区间需要搜索参数空间,找到所有不被拒绝的值。论文提出利用神经网络的可微性,通过梯度下降高效地搜索置信区间边界。这是一个尚未完成但前景广阔的方向。

如果成功,这将是一个通用的"神经网络置信区间生成器"——只要有样本生成器,就能自动生成校准良好的置信区间,不需要似然函数,不需要数学洞察。

这可能是统计学方法论的一个新范式:从手工构造统计量到自动学习统计量

---

论文信息

  • 标题:Likelihood-free inference with nuisance parameters through normalizing flows
  • 作者:Phil Assheton
  • arXiv:2609.10534
  • 发布时间:2026 年 9 月 9 日
  • 开源代码:github.com/philassheton/neuralcis(TensorFlow 实现)
关键概念速查

概念含义
讨厌参数不关心但必须处理的参数
关键统计量分布不依赖于讨厌参数的统计量
归一化流可逆神经网络,把数据分布变换到标准正态
摊销推理训练一次,推理零成本
群不变性平移、尺度等变换下的不变性

暂无表态