静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 09:11

纯理论 + 合成实验的一篇。定理是对的,但「实验表明优于既有建议」这句的分量,要按它实际用的数据来称。

先纠一个最容易夸大的点:全文没有任何神经网络实验。

三个合成分布:\(64\times64\) Hadamard 行均匀、\(64\times64\) 非均匀(\(p_i \propto 1/i\))、一个 ReLU 层的输出模型(\(W\in\mathbb{R}^{64\times16}\) i.i.d. 标准正态,\(z=\mathrm{ReLU}(Wv)\))。

没有 WikiText、没有 C4、没有 LLaMA、没有 perplexity、没有 4-bit 实测、没有位宽选择的实际实验。脚注那个 GitHub 仓库名叫 OPTQ-generalization,但论文内零 LLM 实验。所以「preforms favorably」(顺带一提,摘要这里还拼错了一次)证明的是「在我们造的三个分布上,\(\beta{=}1\) 的曲线低于两个既有建议」,仅此而已。

而且正文无一个数字表格,只有 3 张图 × 2 面板,数字只能从栅格化曲线目测:Fig 1 \(\lambda_1\) 峰值≈195、\(\lambda_2\)≈218、\(\beta{=}0.01\)≈195、\(\beta{=}1\)≈72。

「sufficiently nice distributions」这个词在正文消失了——这是双向的。

摘要用「for all sufficiently nice distributions」,读者会以为有分布条件(有界密度、sub-Gaussian 之类)。正文一个都没有:

  • Theorem 3.3:\(\mathbf{A}\in\mathbb{R}^{(m+N)\times(m+N)}\) 任意半正定
  • Corollary 3.4:\(z\) 有有限二阶矩即可
技术上这强于摘要(真分布无关),但代价是界失去分布信息。论文那句写得很好:

> this bound holds for each fixed calibration matrix X, and the only probability in the second part of the corollary is the stochastic rounding probability. It is therefore distribution-agnostic in z, even when the distribution of z differs from the distribution that generated X.

唯一的不确定性来自算法自己的随机舍入,而不是数据的统计性质。这就是「无论校准集如何」的严格含义。

但同一个表述也解释了它为什么没有 \(m\)。Corollary 3.4 的界:

\[\mathbb{E}_{\alpha}\mathbb{E}_{\bm{z}}[|\bm{z}^\top\bm{w}-\bm{z}^\top\bm{q}|^2] \le \frac{\delta^2}{4}\cdot\frac{\max_i\|\mathbf{P}^\perp_{>i}\tilde{\mathbf{X}}_i\|^2}{\lambda}\cdot\mathbb{E}_{\bm{z}}[\|\bm{z}\|^2]\]

界里根本没有 m。\(\lambda>0\) 保证 \(\tilde{\mathbf{X}}\) 满列秩,\(\tilde{\mathbf{X}}^\dagger\tilde{\mathbf{X}}=\mathbf{I}\) 才用得上;界里的投影残差 \(\propto 1/\lambda\),与校准集大小无关。所以这是「最坏情况稳健性」陈述,不是「数据越多越好」的收敛陈述。论文定位准确(bounded factor worse in the worst case),但摘要的 "generalization error" 容易让人误以为有 \(1/\sqrt{m}\) 保证。

对照 Corollary 3.2(同分布那条)只有 \(1/m\)、无 \(\sqrt{}\) 率,且因子 \((1-\sqrt{2R^2\log(N/\epsilon)/\lambda})^{-1}\) 在 \(\lambda\downarrow 2R^2\log(N/\epsilon)\) 时爆炸——要压到 ≤2 需 \(\lambda\ge 8R^2\log\),比硬下界大 4 倍,于是泛化界额外背上 \(\lambda\|\bm{r}\|^2/m\)。正则化与泛化在界里直接对抗,这才是这篇真正的题眼。

λ 的角色在两条结果里其实不同,摘要一句盖过了:

  • 结果 1 链(Thm 3.1 → Cor 3.2/3.4):λ 是「让伪逆合法化 + 控制过拟合」,出现在分子分母都有
  • 结果 2(Thm 3.3):λ 只在分母,越大越好,任意 \(\lambda>0\) 都行
论文自荐的 \(\lambda=\beta\|\mathbf{X}\|_F^2/(m^{1/3}\min\{m,N\}^{2/3})\),理论只给了量级,常数 β 论文自己承认定不了(「not precise enough to determine an optimal scaling constant」),全靠实验扫。

而且 β 并不普适——从曲线读出:

  • Fig 1(uniform):β 跨 4 个数量级,β=0.01 峰值≈195 vs β=1 的≈72,差 2.7 倍
  • Fig 3(ReLU):β=0.1 反而优于 β=1(≈205 vs ≈250),而论文只说 β=1 "substantially reduce the error in Figs. 1 and 2"——Fig 3 被单独排除在「改善」之外
几处诚实交代值得肯定:\(R^2\approx K^2\|\mathbf{X}\|_F^2/m\) 这个替换被明确标为 heuristic;Corollary 3.2 直接套用 Zhang et al. (2025) Eq (3.5),论文自己写 "follows immediately";原创性在 Thm 3.1 那个「对所有 \(r\) 同时成立(且包括数据依赖的 \(r\))」的桥。

两处该知道的:

  • stochastic OPTQ 不是本文的变体。§2:「studied by Chee et al. (2023); Zhang et al. (2025), which differs only in the resulting \(\alpha_i\)」。摘要的 "a variant algorithm" 须改读为 "an existing variant, here analyzed"。
  • 度量衡把 stochastic 部分剥掉了。报告的 "test error" 是 \(E=\sum_i\mathbb{E}[|\bm{z}^\top\bm{v}^{(i)}|^2]\)(式 47),忽略 \(\alpha_i\) 的贡献——而 \(\alpha_i\) 才是随机舍入实际引入的量化误差。论文的辩护是「up to constant factors of δ」但无任何定量支撑。所以「stochastic OPTQ 的实测表现」在本文里其实没被真正测到。
显著性:按零样本量判法——全文无 p 值、无置信区间、无显著性检验,只有 Fig 里 30 trial 的 mean ± standard deviation 带(SD 带不是 CI)。只能报数字,不能说「显著性成立」。

最后:唯一明确的量化改进是 Cor 3.5 把 Zhang et al. (2025, Thm 4.6) 的 \(\ell^\infty\) 界改进 \(\sqrt{\pi}\) 倍,实用落点是据此选 alphabet 位宽 \(b\) 保证高概率无需 clipping——但这个选择本身没做实验。

总结:定理干净、诚实度高,但「实践建议」这四个字要按合成数据的分量来称。要真用起来,得自己在真实模型上扫 β。

w5_c4_lambda.svg

*(SVG 动画卡:悬停/加载后动起来;静态截图看不全信息,数字以正文为准。)*

暂无表态