[论文] Likelihood-free inference with nuisance parameters through normalizing flows (arXiv:2609.10534)

论文概要 研究领域: ML 作者: Phil Assheton 发布时间: 2026-09-09 arXiv: 2609.10534

论文概要

研究领域: ML 作者: Phil Assheton 发布时间: 2026-09-09 arXiv: 2609.10534

中文摘要

本文提出一种简单的神经网络归一化流分解方法,能够在存在干扰参数(nuisance parameters)的情况下自然地揭示一个近似关键统计量(pivotal statistic),且仅需来自目标分布的样本生成器。该统计量在最小平均KL散度意义下接近关键性,当统计量维度等于参数维度时具有良好的检验功效。它能够融入平移和尺度等群不变性的先验知识。该方法能几乎精确地发现单样本t检验,在约束方差比范围内的最坏情况尺寸上优于Welch检验,并在部分双列相关上实现良好的校准,同时在小到中等样本上比轮廓似然比技术具有更高的功效和更快的速度。

原文摘要

We present a simple decomposition of a neural-network-based normalizing flow that naturally uncovers a pivotal statistic (or something close) in the presence of nuisance parameters, based only on a sample generator from the distribution of interest. We show that the statistic is near-pivotal in the sense of minimum average KL-divergence of its \(p\)-values versus uniform and we argue that it can be expected to have good power when the dimension of the statistic equals the dimension of the parameter. It is able to incorporate prior knowledge about group invariances such as translation and scale. It can discover the one-sample \(t\)-test almost exactly, outperforms the Welch test in terms of worst-case size over a constrained variance-ratio range and achieves good calibration on partial biserial correlations, while showing higher power (and being much faster) on small-to-moderate samples than profile likelihood-ratio techniques.


*自动采集于 2026-09-11*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

神经网络自己重新发现了 t 检验

场景:一个你不知道方差的世界

假设你要测量某个物理量——比如某种新材料的平均导热系数。你有一组测量值 x_1, ..., x_n,想检验假设:真实均值 μ = μ_0。

如果测量误差服从正态分布且方差 σ² 已知,这是最简单的 Z 检验:算样本均值 x̄,和 μ_0 比一比,除以 σ/√n。

但现实中你几乎永远不知道 σ²。你只有一个样本,均值和方差都不知道。

1908 年,William Gosset(笔名 Student)找到了一个精巧的解法:构造统计量

t = √n (x̄ − μ_0) / s,其中 s = √(Σ(x_i − x̄)² / (n−1))

这个统计量的分布——t 分布——不依赖于 σ。不管 σ 是多少,t 的分布都一样。这就是"关键统计量"(pivotal statistic):一个分布不依赖于讨厌参数(nuisance parameter)的统计量。

Gosset 的发现是人类智慧的闪光时刻。他不是去估计 σ 然后代入,而是找到了一种让 σ 自动消失的构造方式。

现在的问题是:神经网络能自己发现这个构造吗?

讨厌参数:统计推断中的"噪声维度"

先说清楚什么是讨厌参数。

在统计推断中,你关心的参数叫"兴趣参数"(interest parameter),不关心但必须处理的参数叫"讨厌参数"(nuisance parameter)。在 t 检验中,μ 是兴趣参数,σ 是讨厌参数。

讨厌参数无处不在:

  • 比较两组均值时,两组的方差都是讨厌参数
  • 回归分析中,误差项的方差是讨厌参数
  • 混合模型中,混合权重是讨厌参数
  • 因果推断中,混杂因素的分布是讨厌参数
理想情况下,你想找到一个关键统计量——它的分布不依赖于讨厌参数的值。这样你就可以对兴趣参数做推断,而不需要先估计讨厌参数。

但找到关键统计量很难。在简单情况下(正态分布、线性模型),数学家花了几十年找到了精巧的构造。在复杂情况下(非参数模型、高维数据、复杂依赖结构),通常没有已知的精确关键统计量。

传统方法是"轮廓似然比"(profile likelihood ratio):先对讨厌参数求最大似然估计,代入似然函数,再构造检验统计量。这在大样本极限下近似关键,但小样本下可能有偏。

这篇论文做了什么

Phil Assheton 在 2026 年 9 月的这篇论文提出了一个出人意料简单的想法:用归一化流(normalizing flow)的分解结构来自动发现关键统计量

归一化流是一种神经网络模型,它学习一个可逆变换 f_φ,把数据分布变换到标准正态分布。训练目标是让变换后的分布尽可能接近 N(0, I)。

关键洞察是:如果你把归一化流的输出分成两部分 z = (z_1, z_2),其中 z_1 的维度等于兴趣参数的维度,z_2 的维度等于讨厌参数的维度,那么z_1 的条件分布(给定 z_2)在训练过程中会自动变得接近关键

为什么?因为归一化流在最小化 KL 散度时,会尝试让联合分布接近标准正态。而标准正态的各分量独立,所以 z_1 的边缘分布不依赖于 z_2 的值。如果 z_2 编码了讨厌参数的信息,那么 z_1 就自然变成了一个(近似的)关键统计量。

这不是强制约束,而是训练目标的隐式偏好。论文证明了:在最小平均 KL 散度的意义下,z_1 的 p 值分布会尽可能接近均匀——这正是关键性的定义。

神经网络重新发现 t 检验

最直接的验证方式:让神经网络面对 t 检验的场景,看它能不能自己发现 t 统计量。

实验设定:正态分布 N(μ, σ²),兴趣参数 μ,讨厌参数 σ。样本量 n。神经网络只有样本生成器(simulator),不知道似然函数。

训练完成后,检查网络学到的统计量。结果:网络学到的统计量几乎精确地等于 t 统计量

这不是巧合。t 统计量是正态分布下唯一的关键统计量(在位置-尺度群不变性下),而网络的架构恰好编码了这种不变性。网络通过训练"发现"了人类数学家在一个世纪前通过洞察找到的构造。

比传统方法更好

论文还在三个经典问题上测试了方法:

Welch 检验(两组均值比较,方差不等):传统 Welch 检验在方差比极端时校准不好。神经网络方法在约束方差比范围内,最坏情况尺寸优于 Welch 检验。

双列相关(biserial correlation):在部分双列相关上实现良好校准。

小样本功效:在小到中等样本上,比轮廓似然比技术有更高的功效,且速度快得多(因为神经网络是摊销的——训练一次,推理几乎零成本)。

核心架构:归一化流的分解

具体来说,归一化流把数据 x 映射到 z = f_φ(x)。把 z 分成两部分:

  • z_interest:维度 = 兴趣参数维度
  • z_nuisance:维度 = 讨厌参数维度
训练时,从各种参数值生成样本,让网络学习把数据映射到标准正态。训练目标是最小化负对数似然:

−log q_x(x) = −log N(f_φ(x)) − log |det ∂f_φ(x)/∂x|

推理时,给定一组观测数据 x_obs,计算 z_interest = f_φ(x_obs)[:d_interest]。然后检查 z_interest 是否落在标准正态的典型集合里。如果兴趣参数的假设值是错的,z_interest 会偏离标准正态,p 值变小。

关键在于:z_interest 的分布在训练目标的驱动下变得不依赖于讨厌参数。这不是硬约束,而是软偏好——但在实践中效果很好。

群不变性的先验知识

论文还展示了一个精巧的设计:可以把已知的群不变性(如平移和尺度不变性)编码进网络架构。

对于正态分布的位置-尺度问题,我们知道:

  • 平移 μ 不应该改变统计量的形式(平移不变性)
  • 缩放 σ 不应该改变统计量的形式(尺度不变性)
通过在网络中使用等变层(equivariant layers),可以强制网络尊重这些不变性。这不仅加速了训练,还保证了统计量的关键性在相关群下严格成立。

这就是为什么网络能几乎精确地发现 t 检验——t 统计量恰好是位置-尺度群下唯一的关键统计量。

摊销推理:训练一次,推理零成本

传统方法(如参数自助法)每次面对新数据都要重新采样、重新计算。归一化流方法训练一次后,推理只是前向传播——毫秒级。

这在实际应用中意义重大。比如在 A/B 测试平台中,每天可能有成千上万个实验需要检验。传统方法需要为每个实验跑自助法(可能几百次模拟),而训练好的神经网络只需要一次前向传播。

论文提到训练在 RTX 3060 笔记本 GPU 上需要 2-4 小时。训练完成后,推理几乎零成本。这是"摊销推理"(amortized inference)的典型优势。

代码仓库

论文有开源代码:github.com/philassheton/neuralcis。代码用 TensorFlow 实现,包含四个示例:

  • t-test:单样本 t 检验的重新发现
  • Behrens-Fisher:两组均值比较(方差不等)
  • biserial_partial_correlation:双列偏相关
  • nuisance_direction_dependencies:讨厌方向依赖
代码结构清晰,核心是 neuralcis.py 中的 NeuralCIs 类。用户需要提供: 1. 采样函数(simulator):给定参数,生成样本 2. 兴趣函数:从参数中提取兴趣参数 3. 估计函数:从统计量反估参数

然后声明参数类型(位置、尺度、正计数等),网络自动学习关键统计量。

更深的问题:神经网络在做什么

这篇论文引出一个深层次的问题:神经网络在"发现"还是"记忆"关键统计量?

在 t 检验的例子中,网络学到的几乎精确等于 t 统计量。但 t 统计量是数学家在一个世纪前通过洞察发现的。网络是通过训练数据"猜"到了这个构造,还是通过架构的归纳偏置(invariance + 分解结构)被迫收敛到这个解?

论文的论证倾向于后者:当架构编码了正确的群不变性时,关键统计量是唯一满足不变性条件的分解。网络不是在"发现",而是在"被约束到"正确答案。

这和最近的研究趋势一致:神经网络的泛化能力很大程度上来自架构的归纳偏置,而不仅仅是数据。在这里,归一化流的分解结构 + 群等变层 = 自动发现关键统计量。

对统计学的启示

这个结果对统计学方法论有三个启示:

第一,"让数据说话"可以走得更远。 传统统计学强调先验知识(分布族、参数化模型)的作用。这篇论文展示,只要有样本生成器,神经网络可以自动发现传统方法需要数学洞察才能找到的构造。

第二,关键性不一定是精确的,可以是近似的。 论文的方法在 KL 散度意义下"接近关键",但不一定精确关键。这在实践中可能足够——精确关键性在复杂模型中通常不可达,而近似关键性可以提供良好的校准。

第三,摊销推理改变统计学的经济学。 传统方法每次推理都要重新计算,限制了在大规模场景中的应用。摊销推理把训练成本分摊到大量推理上,使得高频统计推断成为可能。

一个未解的方向

论文在结论中提到一个雄心勃勃的目标:从 p 值到置信区间。

当前方法生成的是 p 值——给定假设的参数值,数据有多极端。置信区间是反向问题:给定数据,哪些参数值的假设不会被拒绝?

从 p 值到置信区间需要搜索参数空间,找到所有不被拒绝的值。论文提出利用神经网络的可微性,通过梯度下降高效地搜索置信区间边界。这是一个尚未完成但前景广阔的方向。

如果成功,这将是一个通用的"神经网络置信区间生成器"——只要有样本生成器,就能自动生成校准良好的置信区间,不需要似然函数,不需要数学洞察。

这可能是统计学方法论的一个新范式:从手工构造统计量到自动学习统计量


论文信息

  • 标题:Likelihood-free inference with nuisance parameters through normalizing flows
  • 作者:Phil Assheton
  • arXiv:2609.10534
  • 发布时间:2026 年 9 月 9 日
  • 开源代码:github.com/philassheton/neuralcis(TensorFlow 实现)
关键概念速查

概念含义
讨厌参数不关心但必须处理的参数
关键统计量分布不依赖于讨厌参数的统计量
归一化流可逆神经网络,把数据分布变换到标准正态
摊销推理训练一次,推理零成本
群不变性平移、尺度等变换下的不变性
暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens