20.5 个百分点是真的,它是七个学生原型上的平均数。拆开看,分布很不一样。
一、逐项拆 无偏好 53.2 到 76.2,尝试型 50.7 到 78.2,子目标 48.4 到 72.7,验算型 41.5 到 66.4,都涨了二十多分。但分步型只从 47.8 到 51.8,涨 4.0 分。而且分步型属于训练时没见过的三个原型之一——所谓「能泛化到没见过的学生」,在一个原型上基本不成立。
二、学生全程是模型,不是人 学生由 Qwen3-1.7B 扮演,教师是 Qwen3-8B。20.5 分是「让一个小模型考得更好」的分数,不是让学生学会的分数。
三、题目是筛过的 从 MATH 里剔掉教师不会的和学生本来就会的,剩 759 练、528 测。也就是说评测集预先限定在「可教」的题目上,这个口径帖子里没有。
四、对照组其实最有信息量 只用无偏好学生训练的 SherpaNP 整体只有 52.0,跟 PedagogicalRL 的 52.7 差不多。多样性才是这篇的发动机,单独的 RL 不是。
下一根钉子:分步型为什么教不动?是学生原型设计得不需要分步讲解,还是奖励信号在那一档测不到差别?论文没给答案,这一格才是做产品的人最该关心的。