这是我这轮核得最干净的一篇
2383 人、17.5 万条对话、p = .015、5/7 领域、2028 次成对评分、4.81 vs 0.0052、p = .044、链条上每一环 p < .002——我逐条对回 arXiv 摘要,一个不差。
而且你开头那段「抓不同的侦探 vs 指纹鉴定员」把等价性检验讲透了,这是绝大部分转述会讲反的地方。该夸就夸。
剩下两处,都不是错,是引用时容易被自己再算一遍的地方。
一、4.81 ÷ 0.0052 = 925,不是 918
摘要里 918 和 0.0052 是两个并排出现的数,直接相除得 925。差 0.8%。
【推论】合理的解释是:918 用的是未四舍五入的 0.00524(4.81 ÷ 918 = 0.005240)。所以两个数都出自原文、都对,只是精度不同。
结论:引用 918 没问题,但别在文章里再自己除一遍给读者看——除出来是 925,会显得你算错了。
二、"一个百分点"被你后半段悄悄改成了"一分"
【直引】摘要原文是 per percentage point gained(每提高一个百分点)。你前面写对了,后面写"几分钱,买一分成绩"。
GRE 单科满分 170,一个百分点与一分不是一回事。这个换算方向是:每分反而更便宜(0.0052 ÷ 1.7 ≈ 0.003 美元)。所以你的修辞其实低估了自己的论据。
三、一个值得挂牌的格子
【直引】论文在 arXiv 上一作挂 MIT(Northcutt,cleanlab 创始人,这点你写了),但项目 GitHub 组织是 Handshake-AI-Research。
【判断】我不认为这构成利益冲突——平台免费开放、数据可下载、47 页含附录,透明度在同类研究里算高的。但"开放评测基础设施"背后有家 AI 数据公司这件事,值得在正文里挂一行,让读者自己判断。
四、为什么说这篇真正的贡献不是结论
结论是"在 GRE 短期增益这一个被严格测量的指标上等价"。这结论朴素到上不了热搜。
真正值钱的是 StudentBench 这个平台本身:一个能跑随机对照、能逐字收师生对话、能对公众开放的教学评测基础设施。今天比 GRE,明天能比长期记忆、比写作、比编程教学、比"第二年还记不记得"。
【判断】教学研究几十年做不了 RCT,卡在伦理、经费、流失三座山上。这个平台把三座山都绕开了——随机分组在这里不构成伦理难题,因为学生本来就是来领免费辅导的,分组只决定领取方式。这一句你写了,但它的分量比"918 倍"重。
下一根钉子
学习增益是"学完立刻测"的即时收益。三个月后还剩多少,论文没测,也没人测。这是这篇唯一真正悬空的格子——如果 AI 教的知识像沙滩上的字,"等价"两个字三年后会被重写。