越像目标,越不迁移:按语义相似度挑训练数据,这篇给了反例
arXiv:2610.00331 的问题很实在:给数学题挑训练数据,源数据跟目标「同主题」还是「同推理方法」,哪个迁移更好?设计上用了两个平衡交叉 2×2(概率×组合 交叉 不变量推理×双重计数,2,000 题;数论×几何 交叉 补集×鸽巢,800 题),每个格轮流当留出目标,转满一圈后任何单格的天生优劣被等权抵消。
结果干净得不像话:40/40。 5 个基座模型 × 4 个目标格 × 2 个设计,种子池化后同方法(SA)全部优于同主题(ST)。模型级优势设计一 +10.8 个百分点(8.2 到 16.2),设计二 +14.3(12.0 到 16.0),十个 95% 置信区间全部排除零。种子级最小对比 +7.4,没有一个为负。
对「语义相似度选数据」范式是正面一击。 作者用 Qwen3-Embedding 加 TF–IDF 六个指标(含中心化嵌入)实测:ST 源在每一个陈述级指标上都更像目标——嵌入 NN 0.739 对 0.705,第二设计 0.727 对 0.544——却迁移更差。也就是说,当前广泛使用的「按嵌入相似度挑邻近例题」的直觉,至少在参数更新场景下与迁移效果排序相反。
可执行形态要说清:不是「同主题有害」,是「同主题帮助小」。 四个模型上 SA/ST 双涨,SA 快 4–8 倍(SA +11~17 pp 对 ST +2~7 pp);Qwen 是负迁移镜像(SA +9.9、ST −6.3,且 ST 在每个目标上都负)。另外提醒引用数字的人:多模型 base 准确率在 0.4–2.2% 区间,所谓「提升 10 pp」很多是从地板爬升,必须带 base 读。数据量消融(单种子,证据弱)显示优势随数据单调扩大:+7.5→+9.7→+11.4。
硬边界也列一下:无代码无数据;CI 只覆盖评测集不确定性、不含训练种子变异、未做多重比较校正;旋转设计不消除 source–target 交互;题目的生成、方法标注、答案审计全部由 LLM 互审完成。以及每个源格只用了 450 题、rank-16 LoRA、约 87 步——如果这个排序在这么小的规模上就稳定,外推值得试。
还有两处原帖没提的读表提醒。一是目标级极差很大:最小 +2.8 pp(Gemma 的组合×双重计数格),最大 +27.9 pp(Qwen 的组合×不变量格),别只引均值。二是相似度的「6/6 全指 ST」要加一个脚注:附表 13 的最近邻归属只有 3/4 单元 ST 占优,概率×不变量的 C/I 单元反而是 SA 52.8% 对 ST 47.0%——「ST 更像目标」是大数结论,不是每个格都成立。另外作者自己给目标级对比划了界:目标级结果分不清源质量与真正的目标-方法交互,明确说不把模式解读为「不变量推理本质上更可迁移」。引用时带上这句,结论才站得住。