「一致优于」这个词,和正文给出的区间对不上。
一、把差距和噪声放在同一把尺子上量
Table 1 的 Citeseer 行:最强基线 FF-G2M 72.85 加减 1.59,G²MLP 74.51 加减 2.35。
差距 1.66 个百分点。1.66 除以 1.59 等于 1.04 个基线自身的标准差;1.66 除以 2.35 等于 0.71 个自身标准差。
而论文给的完整区间是【直引】「improving over the strongest baseline ... by 0.16 to 1.66 pp」。
下界 0.16,除以种子标准差下界 1.59 是 0.10。
【判断】方法之间的差距整体落在 0.1 到 1.0 个种子标准差之间。虽然报了 10 个种子,但差距比噪声小一个数量级。摘要的「consistently improves」是修辞,正文的数字撑不起这个强度。
二、有一个数据集是负增益,而且幅度是噪声的 17 倍
【直引】「G²MLP further surpasses the GraphSAGE teacher on five of the six datasets, with gains up to 4.02 pp on Citeseer; only on ogbn-Arxiv does the student fall short of the teacher (-6.16 pp)」。
Table 1 的 Arxiv 行:SAGE 70.73 加减 0.35,G²MLP 64.57。差 6.16 个百分点,除以教师的标准差 0.35 是 17.6 个标准差。
这不是噪声。这是六个数据集中最大的那一个,而它是唯一失败的那个。
论文还有一句【直引】「G²MLP achieves the best graph-free production accuracy on 5/6 datasets, with gains of 0.16–1.60 pp」——把「六个一致」悄悄改成「五个之一」的地方,就在摘要旁边。
三、迁移实验排掉的,恰好是唯一失败的那个
帖子说「无需架构改动即可迁移到 Graph Transformer 教师和链接预测任务」。「无架构改动」这部分属实,原文有支撑:「The student is the same MLP used throughout」。
但 GT 实验的适用范围有明确排除:【直引】「Experiments use the same five datasets as Section 5.2 except ogbn-Arxiv, which exceeds GraphGPS dense-attention memory」。
5 个数据集,不是 6 个。排除的理由是显存,而排除掉的恰好是 G²MLP 唯一没能打过教师的那一个。
这不是作弊——ogbn-arxiv 确实装不下稠密注意力。但读者容易以为迁移结论覆盖全部基准。
四、机制主张在自己没测的场景里最需要验证
论文的核心机制是「稀疏图上遗漏集中在边界区域附近的高能教师方向」。而边界和标签混合最极端的场景是异配图。
【直引】Appendix H:「Our empirical evaluation is restricted to homophilic node-classification benchmarks (Cora, Citeseer, Pubmed, A-computer, A-photo, ogbn-arxiv) ... On strongly heterophilic graphs (e.g., Texas, Wisconsin, Chameleon, Squirrel) where neighborhood distributions are multimodal and label-mixed, the diagonal Gaussian surrogate may underrepresent the true alignment cost, and the curvature-stratified weighting may require sign-flipped variants. A systematic heterophilic evaluation ... is left to future work.」
六个数据集全是同配的。四行悬而未决:那个「对角高斯代理」在异配图上可能低估对齐代价,曲率分层的权重可能需要符号翻转的变体。
【推论】一个关于「边界区域」的方法,在边界最模糊的图上没有测过,而且作者自己说那里可能要改符号——这是最该先补的一格。
五、理论部分只是上界,作者明确说没证下界
【直引】Appendix H:「Lemma 3.1 and Proposition 3.2 are upper bounds and structural statements ... We do not establish matching lower bounds, and in particular do not prove that the curvature-stratified regimes are necessary for closing the spectral mismatch — only that they are theoretically well-motivated and empirically effective.」
还加了一句:「A complete characterization of which graphs and which teacher kernels demand curvature-adaptive treatment ... is an open theoretical question.」
所以摘要里「曲率识别出两种谱误差的集中位置」这个断言,理论强度是「上界加结构陈述」,不是因果刻画。缺口是双向的:不只有下界没证,连「按曲率分层这件事是必要的」都没证。
六、最强的两个同类方法没被比较
【直引】「We do not compare against positional-encoding augmented variants (e.g., NOSMOG) ... or codebook-augmented variants (e.g., VQGraph) ... Both depart from setup, precluded fair comparison.」
NOSMOG 恰好是两处标准设置的来源:prod = 0.2×ind + 0.8×tran 就是引自 Tian et al. 2023,也就是 NOSMOG;而 LP 实验里「多任务对纯蒸馏」两种设置的对齐对象也是它。
所以「不可公平比较」的这个方法,贡献了本文复合指标的定义;而本文没和它比。
七、复合指标里 inductive 只占 20%
prod = 0.2×ind + 0.8×tran——生产分里 inductive(未见节点)只占 20%,transductive 占 80%。
论文自己说 inductive 上提升更大(2.07 到 2.69 个百分点,Cora/Citeseer/Pubmed/A-computer),但那一项在总分里只有五分之一权重。所以「5/6 个数据集的最佳生产分」这个判断对权重选择是敏感的,而这套权重来自被排除的那个方法。
八、两种谱误差的贡献其实不对称
欠拟合(稀疏图):pointwise KL 无法恢复漏掉的高能方向——因为缺失方向在概率分布上影响小,KL 看不见,必须用表示级对齐。
过拟合(稠密图):pointwise KL 会压低近零的教师方向——而教师在密集区已经坍缩成近零,所以 KL 天然做对了一半。
【推论】所以「在两种机制下均减小师生秩差」这个结论,稠密图那一侧部分是免费的,稀疏图那一侧才是方法真正的贡献。帖子把两者并列,贡献的不对称被抹平了。
九、两条反直觉的,帖子没写
去图的学生在部分数据集上打赢了有图的教师:【直引】「on Citeseer and Pubmed (prod), G²MLP surpasses the teacher by 3.61 and 2.68 pp」;以及 A-computer 上 82.67% 对教师的 82.83%,「essentially matching」。
这是卖点,但也隐含一个不便明说的解释:教师本身未必被充分调优,学生蒸馏时相当于获得了一次「教师加新配方」的联合收益。
还有一条设置细节:学生用的学习率、权重衰减、dropout 直接沿用 GLNN 发布的配置、未做调参,只有 loss-balance 超参按数据集设置。
成本侧:per-node 是 O(H+C);全协方差变体需要 per-node O((H+C)³) 的矩阵平方根,作者认为不划算,低秩协方差是更有希望的方向。
那个对角高斯代理也不是精确的——【直引】「This surrogate is exact only when the underlying neighborhood distribution is itself Gaussian with diagonal covariance」。
链接预测部分我核到一处不完整:Table 4 的 G²MLP 行在本次抓取的 HTML 转换里没完整取到,所以链接预测的具体数字核不到。原文只说「where KRD already exceeds the teacher, the margin over KRD is smaller」——而 LP 里 KRD 等基线本来就超过教师。
下一根钉子:把 G²MLP 放到 Texas、Wisconsin、Chameleon、Squirrel 这四个异配图上。论文自己说了曲率加权在那里「may require sign-flipped variants」——如果符号翻转成立,说明当前方法把「聚合过度」和「标签不一致」当成了同一种谱误差;如果不成立,那说明异配图的高能方向本来就集中在别处,两种失效模式的划分本身就不完整。这四个数据集很小,跑一遍的成本远低于复现六个同配基准。