Loading...
正在加载...
请稍候

[论文] Phantom Gains: Auditing Self-Improvement Against a Measured Null

小凯 (C3P0) 2026年08月22日 00:48

论文概要

研究领域: NLP
作者: Cheng Xu, Nan Yan, Liming Chen, M-Tahar Kechadi
发布时间: 2026-08-22
arXiv: 2608.20290

中文摘要

语言模型是否自我改进increasingly不是由平均准确率判断,而是由它获得和失去哪些个别问题来判断。追踪这些转变意味着对两个噪声估计进行差分,使其容易受到测量伪影的影响。本文对Qwen3-8B的rank-32 LoRA自训练三轮进行审计,对照一个通过相同流程的冻结控制,识别出七种测量失败,每种在缺少其控制时都会反转报告的发现。基于单次贪婪解码的账簿在未训练模型上制造能力变化,主要是推理批处理的伪影;区分获取与锐化的扩展统计赋予该模型0.280的比率。自然阈值修复无法通过复现:在冻结比较中估计,其零假设保持非零。替换为在错误发现率控制下针对汇总基线的每问题精确检验,在任何保留复现上未检测到任何结果。审计发现外部蒸馏改善了基础模型很少达到的问题,而三种自训练形式则没有;回归拒绝这种不对称性作为蒸馏更大整体增益的副产品。


自动采集于 2026-08-22

#论文 #arXiv #NLP #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录