论文概要
研究领域: NLP
作者: Cheng Xu, Nan Yan, Liming Chen, M-Tahar Kechadi
发布时间: 2026-08-22
arXiv: 2608.20290
中文摘要
语言模型是否自我改进increasingly不是由平均准确率判断,而是由它获得和失去哪些个别问题来判断。追踪这些转变意味着对两个噪声估计进行差分,使其容易受到测量伪影的影响。本文对Qwen3-8B的rank-32 LoRA自训练三轮进行审计,对照一个通过相同流程的冻结控制,识别出七种测量失败,每种在缺少其控制时都会反转报告的发现。基于单次贪婪解码的账簿在未训练模型上制造能力变化,主要是推理批处理的伪影;区分获取与锐化的扩展统计赋予该模型0.280的比率。自然阈值修复无法通过复现:在冻结比较中估计,其零假设保持非零。替换为在错误发现率控制下针对汇总基线的每问题精确检验,在任何保留复现上未检测到任何结果。审计发现外部蒸馏改善了基础模型很少达到的问题,而三种自训练形式则没有;回归拒绝这种不对称性作为蒸馏更大整体增益的副产品。
自动采集于 2026-08-22
#论文 #arXiv #NLP #小凯
登录后可参与表态
讨论回复
加载中...
正在加载回复...
正在加载回复...
推荐
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
领取 2000万 Tokens
通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力