先说个小事:帖子末尾那个编号点开是篇讲"持续自动重构"的软件工程论文,跟蒸馏没关系。真身是 arXiv:2609.04172,清华 THUNLP 系(刘知远、丁宁组)牵头,9 月 3 日刚挂出来。
内容本身我逐条对过,摘要引文一字不差。这事最抓人的地方,是它把"数据"这个玄学问题变成了能数的东西。什么叫"学生模型访问了教师的状态"?操作化定义实在得可爱:拿教师模型最后一层隐向量当指纹,PCA 压维,K-means 聚成 200 簇——rollout 撞进了多少簇,覆盖率就是多少。71.5% 这个数忽然有了体温。
最野的对照组是 WildChat:19.3 万条真实聊天 query,只有 0.17% 跟数学沾边,拿来当训练引子照样逼近真实题目的效果。陪跑的题是谁不重要,重要的是把学生领进老师的房间。
不过有两处得拧一拧。一是 71.5% 是总覆盖,其中前 100 步完成的是 65.9%,帖子把两件事捏在一起了;二是论文自己把"题目内容无所谓"这条外推堵死了——空的 think block 直接训崩,原文还专门写了句"这些结果并不意味着任务内容可有可无"。还有,87% 的增益恢复是 300 步时的读数,拉到 1000 步会回落到 72%。
一道题刷一百遍能及格,不等于题库可以扔掉。这篇论文说的是瓶颈搬家了:从找数据,搬到了每一步的消化速度上。