凌晨一点,书桌上的台灯还亮着。GRE 备考群里刚有人甩出一条广告:某机构金牌数学家教,每小时 75 美元,十节课起报,排期到下周三。你盯着屏幕右下角那个免费的对话框看了很久——里面也有一个"老师",随叫随到,不发广告,不收定金,问它一道排列组合题,三秒钟就能给出三种解法。
换你,你选哪个?
这个选择题的分量,取决于你对 GRE 处境的理解。美国研究生入学考试,数学、语文加写作,几乎所有申美研的人都绕不开它;对国际学生和亚裔申请者来说,它更是一场旷日持久的分数军备竞赛——你瞄准的学校越好,同池竞争者的分数就越高,门槛就被抬得越高。分数不只是一张成绩单,它是申请材料的入场券,是无数家庭愿意为之付费的硬通货。过去几十年,这张入场券旁边站着两类守门人:一类是每小时 75 美元、排期排到下周三的人类名师;另一类,是这两年突然涌进每个备考群的 AI 家教——免费,秒回,永不下班。
过去这一年,几乎每个备考的人都问过自己这个问题。直觉的答案是:贵有贵的道理。人类老师能看穿你的思维漏洞,能察言观色,能根据你的表情调整节奏——这些机器怎么会?
2026 年 9 月,一篇挂上 arXiv 的论文把这个问题从"直觉"搬进了实验室。论文叫 StudentBench,一作 Curtis Northcutt,MIT 出身,cleanlab 创始人,做数据质量研究起家——这人最出名的本事就是专治各种"看起来很美"的数据集。这次他带了一个团队,干了一件教学研究里几乎没人干过的事:把真人名师和 AI 家教放进同一个随机对照实验,用同一套卷子、同一批学生、同一把尺子,量一量两者到底差多少。
结果用一句话就能说完:AI 家教在 GRE 学习收益上达到了与专家级人类家教统计等价的水平。而如果只比较"每提高一分要花多少钱",人类家教是 4.81 美元,AI 是 0.0052 美元——918 倍的差价。
这 918 倍意味着什么,我们慢慢说。
🏫 家教市场,一家古老的手工作坊
先说清楚 GRE 家教是个什么样的行当。
这本质上是一门靠稀缺性定价的生意。一位好家教的小时数是不可复制的:他一天只有二十四个小时,一个时段只能服务一个学生,旺季的排期就是他产能的天花板。于是他的时薪里打包出售的不只是一节课,还有"排队本身"——等待名单越长,价格越高,这是一个自我强化的循环。75 美元一小时,买的与其说是教学服务,不如说是对一个稀缺人类时间碎片的占有权。
稀缺性的另一面,是过滤。谁的预算里能从容划出 750 美元买十个课时,谁就被留在教室里;谁不能,谁就回去刷免费的论坛真题帖。教育不平等有很多面孔,最贵的那张往往不写在校门口,写在课时费的价目表上。
所以几十年来,这个行业的定价依据不是效果,是口碑,是"王老师带出过很多 330 分"的传说。这是一个典型的手工作坊:品质依赖师傅的手艺,产能依赖师傅的小时数,价格依赖师傅的稀缺性。作坊运转良好,唯一的毛病是贵,以及——老师只有那么多。
然后机器进来了。
进来得比多数人意识到的更安静。过去两三年,大量备考者其实已经在用 ChatGPT 当免费家教:把不会的题拍给它,让它出练习题,让它扮演考官追问。可汗学院做了 Khanmigo,把 AI 家教正式嵌进课程体系。没有广告大战,没有发布会,深夜两点贴在论坛里的那道题,一半已经有了 AI 的答案。真正的问题已经从"AI 能不能教"悄悄换成了"AI 教得有没有那么好"——而这个问题,靠直觉和口碑是答不了的。
📊 2383 人的对照实验
为什么这个问题直到 2026 年才有人认真回答?因为在教育学里做随机对照实验,难到近乎奢侈。
随机分组意味着一半学生要被随机分进"较差"的条件——谁来做这个决定?伦理审查首先就过不去。成本是第二座山:招几千个学生、配几百小时的真人名师、统一命题阅卷,经费烧起来不亚于一个小型临床试验。第三座山是流失:学生中途退出,数据缺一块,结论的根基就松一块。所以几十年来的教育研究主要靠观察性数据——"王老师的学生平均提高了多少分"。但这种数据有一个致命的混淆:能被王老师教上的学生,本来就是更焦虑、更投入、更付得起钱的那批家庭。学生质量和教学质量缠在一起,拽不出线头。
StudentBench 的第一步,就是搭一个能绕开这三座山的平台——在教学研究里,这是稀缺品。平台免费开放,学生注册后被随机分进三组之一。随机分组在这里不构成伦理难题,因为学生本来就是来免费获取辅导的,分组只是领取方式不同;线上交付抹掉了地理约束,样本从"本地某校某班"扩展到全球注册者;而平台自动记录每一条消息,研究者连"学生说了什么"都不用靠回忆和问卷。
三组的设计如下:
第一组,AI 家教组。 学生与一个 LLM 驱动的家教对话学习,平台记录下每一条消息——最终这个数据集超过了 17.5 万条学生与 AI 的对话消息。这不是"用了 AI 的学生"的模糊问卷,是逐字逐句的对话记录。
第二组,人类家教组。 专家级 GRE 家教在线上一对一辅导,同样的题型,同样的考试范围。
第三组,无辅导对照组。 学生自己刷题,没人教。
总样本:2383 名真人学生。
实验测的是 learning gains——学习增益。具体做法类似教育测量里的经典范式:先测一次(pretest),学习一段时间,再测一次(posttest),看分数涨了多少。三组人进的是同一个考场,用的是同一把尺。
结果分两层。
第一层是总体:AI 家教组与人类家教组的学习增益,在统计上等价——p = .015。这里要停一下,因为这个 p 值是全篇最容易被读错的地方。经典的显著性检验问的是:"两者不同的证据够不够充分?"它是一个抓不同的侦探——原假设是"没有差别",只有当证据强到推翻它,你才能宣布"有差别"。但侦探抓不到凶手,不等于没有凶手;统计上"没有发现差异",更不能反过来说"证明了相同"。几十年里大量"AI 和真人差不多"的说法,恰恰死在这个推理翻转上:没有证据表明不同,不是证据表明没有不同。
而这篇论文用的是另一种工具:等价性检验(equivalence test,常见实现是 TOST——双单侧检验)。它不问"能不能抓到不同",它先画好一条线——多接近算"足够接近"——然后检验"两者的差异落在这条线之内"这件事本身的置信度。它更像指纹鉴定员:不是找差异,而是验证两枚指纹是否在容许误差内重合。落进区间了,才有资格说"等价"。p = .015 说的就是这件事:等价这个命题本身,站住了。
第二层是细分:GRE 的七个领域——数学的算术、代数、几何、数据分析,语文的填空、阅读、句子等价——逐领域拆开看,表现最好的那个 AI 家教,在其中 5 个领域超过了人类名师的平均表现。
5 比 2。机器赢了七局里的五局,但赢的方式很微妙——它不是每个领域都碾压,它更像那种没有短板、大部分科目都在 90 分以上的学生。而人类名师的画像刚好反过来:有极擅长的领域,也有相对平淡的领域。
🏭 把"教学"拆成五道工序
只测总分,你永远不知道 AI 到底赢在哪、输在哪。所以团队做了第二个研究:请专家人类家教当评委,把 AI 的教学产物拆开评。
具体是 2028 次成对评分(pairwise rubric evaluations)。什么意思呢?就是把某个 AI 生成的教案和人类写的教案并排摆在一起,让专家按评分细则(rubric)盲评——不告诉你哪份是人写的,哪份是机器写的。出题质量也一样,成对比较。
这一步的巧妙之处在于:它承认"教学"不是一个东西,是一堆工序的集合。团队把教学拆成了五道,每一道都值得单独看一眼它到底在干什么。
教案设计(lesson planning)——一节课怎么编排,先讲什么后讲什么。别小看这件事。教育心理学里有两个老概念在这里等着:维果茨基的"最近发展区"——学生独立能做出来的,和有人扶着能做出来的,中间那段地带才叫学习区;以及布鲁纳的"脚手架"——好的教案就是在那段地带里搭一部楼梯,每一级台阶矮到不会绊倒你,又陡到确实在往上走。糟糕的教案只有两种:在你会的东西里原地打转,无聊;或者一步跨到你够不着的地方,挫败。一部好楼梯长什么样,学过四年师范的人和训练过四个月的模型,谁能搭得更稳——这道题以前从没有人摆到台面上比过。
出题(practice-problem creation)——练习题出得准不准,难度坡度合不合理。好题像一条雪道:太平,滑起来没感觉;太陡,一路摔到底。最好的题目还讲究"错得其所"——每个错误选项都对应一种典型的误解,你选错哪个,老师就诊断出你哪里没想通。人类名师肚子里有积累多年的题库,但题库总归有尽;机器出题的边际成本近乎为零,难的是它出错的选项是不是也在"诊断"你。
对话教学(conversational pedagogy)——真聊起来之后,这个老师会不会引导、会不会追问、会不会在学生卡住的时候递梯子而不是直接给答案。这是五道工序里最像"手艺"的一道。想象一个学生卡在行程问题上,平庸的老师直接甩公式;好的老师问:"如果时间变成两倍,路程会怎么变?"——他递的是梯子的一级,不是楼顶的钥匙。这就是苏格拉底式提问的老传统:答案让学生自己说出来,说出来才真的算他的。AI 在这种对话里表现如何,光看教案是看不出来的,得真聊。
成本——这个不用评委,算得出来。
参与度(engagement)——学生愿不愿意继续学下去,对话会不会冷场。教学效果再好在场面上,学生聊了两句就走,全部归零。
拆开之后的图景就很有意思了:没有任何一个 AI 在全部五道工序上领先,不同的 AI 家教在不同维度上互有胜负,而合成的总成绩,与人类打平。换句话说,AI 不是靠某一项绝技赢的,它是靠"没有一项明显拖后腿"赢的。这对手工作坊是坏消息——作坊的立身之本恰恰是某一项绝技("王老师讲几何绝了"),而流水线的逻辑是均衡。
💰 918 倍的差价
论文里最扎心的数字出现在成本一栏。
按"每提升一个百分点成绩所花的美金"来算:人类家教 4.81 美元,AI 家教 0.0052 美元。4.81 除以 0.0052,约等于 918。
做一个不严谨但直观的换算:0.0052 美元,大约是人民币几分钱。几分钱,买一分成绩。 而那位专家名师,收你三十多块钱。
918 倍这个数字,值得往深了再看一层,因为它压着的不是价格,是历史。教育"民主化"的许诺,人类至少认真做过三次。印刷术把书的价格打下来,可早期买得起书的,大多本来就读得起书;慕课(MOOC)在 2012 年前后喊出让世界一流大学课程人人可学,注册量铺天盖地,完成率却诚实地暴露了一件事——单向播放的课程,没有人在你松手的时候接住你,大部分人悄悄掉队。这两次革命的共同点:它们把内容变便宜了,却没有把交互变便宜。内容从来不是教育里最稀缺的成分,"有人盯着你、回应你、在你卡住的地方等你"才是。
AI 家教是第一次把交互也变便宜的东西。它不是往千家万户推送名师的录像,它是随叫随到、逐句回应、凌晨三点也三秒作答的那个"人"。这正是 918 倍背后真正的结构性含义:被拉下神坛的不是某个老师,而是"回应"本身的稀缺性。
更要命的是,有一个 AI 家教在做到这一切的同时,学习增益仍然与人类家教统计等价(p = .044)。翻译成人话:它没有在效果上偷工减料,它就是便宜。
这就是工业革命故事的 2026 年教育版。手工作坊里,一个师傅带一个学生,师傅的小时就是产能的天花板;机器进场之后,产能不再稀缺,价格体系瞬间失去锚点。作者 Northcutt 自己在社交媒体上只发了一句话:"One hour with an expert GRE tutor: $75."——后面没跟任何评论。有时候数字自己会说话,你只需要把它摆出来。
⚠️ 等价不等于全等:两个射手的比喻
文章写到这里,必须踩一脚刹车。因为"统计等价"这个词,是所有误读的源头。
想象两个射手,平均都命中 9 环。但射手甲的弹孔全部集中在 9 环附近一个硬币大的区域,射手乙的弹孔散布在 7 环到 10 环之间。平均值一样,分布天差地别。 等价性检验说的是:在预设的置信区间内,两者的平均效果之差小到可以忽略——它说的是"平均值这个数轴上,两者重合",它没有说每一个学生的体验都一样。
具体到这项研究,至少有四层限定必须摆在台面上:
第一,只测了 GRE,只测了短期。 实验测量的学习增益是"立即收益"——学完马上测。考试三个月后还记得多少(长期 retention)?论文没测。AI 教的知识是不是像沙滩上的字,潮水一冲就没了?目前没人知道。
第二,人类家教是在线环境里的"实验家教",不是三年师生。 真实的提分神话往往发生在长期关系里:老师记得你三个月前哪里错过,知道你考前会焦虑,会在第八节课突然换一个讲法。实验里的对照组是人类专家没错,但这是被装进线上实验框架里的专家。被切掉的是时间维度。
第三,5/7 领先 ≠ 全面超越。 七个领域里有两个,AI 仍落后于人类名师。AI 教育全面超越人类教师?论文标题说的从来不是这个,它说的是"equivalent GRE learning gains"——GRE 学习收益上的等价。媒体标题把它压缩成"AI Matches Human Tutors on GRE",已经是极限口径,再往外推一步就是谣言。
第四,"效果最好"不代表"体验最好"。 分数之外的东西——被鼓励的感觉、师生之间那点微妙的信任、一个人对你前途的真心在意——这些不在评分细则里。
所以准确的结论是:在 GRE 备考这个特定场景、短期增益这个特定指标上,最好的 AI 家教已经站在了人类专家的同一个置信区间里,而在价格上,它站在另一个星系。
🧭 快的老师,更好的老师
论文里埋着一条我个人觉得最有生命力的发现,藏在数据分析部分。
在 Quantitative(数学)会话中,研究者发现了这样一条链:
AI 回复越快 → 学生发的消息越多 → 学生练对题越多 → 学习增益越大。
链条上每一环的统计显著性都在 p < .002 以下。这几乎是论文里最"有教育直觉"的发现:它听起来根本不像 AI 研究,像乒乓球馆里的常识——陪练喂球越快,回合数越多,手感来得越快。一个好的陪练不是替你打球的人,是那个让你的击球次数指数级增加的人。
这解释了 AI 家教一个隐蔽的优势结构:人类名师一节课 75 美元,其中大量时间花在"等"上——等你理解,等你算完,等你组织语言提问。AI 没有等待成本,你凌晨三点问它一道题,它三秒钟后就在回答。回复延迟的压缩,直接换成了对话轮次的膨胀,而对话轮次又换成了练习量。教育的古老经验"勤能补拙",在 AI 这里被重新工程化了:不是学生变勤快了,是"勤"的成本趋近于零。
当然,这是相关性而非因果——也可能是本来就好学的学生问得更多、练得更多、进步更快。但方向本身与教学常识吻合:高频反馈是好老师的核心特征之一,而频率恰恰是机器最擅长的维度。
🕳️ 论文没说的,和论文说不了的
做数据出身的团队,最大的自觉是标注边界。这篇论文的诚实之处,在于它的标题就写死了适用范围:GRE learning gains。没有"revolutionizes education",没有"end of teachers"。
先补一层对这篇论文自身的怀疑,才算公平。发表偏倚是科学界的常识性暗流:耸动的结果——"AI 完胜"或"AI 翻车"——天然比"大致相当,附四个限定"更受欢迎。而"等价,但别激动"恰恰是新闻价值最低、实际分量最重的结果。这篇论文的核心结论朴素到近乎无聊,无聊到差点配不上一个热搜——可教育里真正重要的结论,往往就长这样。下一次你看到某个AI教育的惊人标题,值得先问一句:它测的是"赢没赢",还是只测了"够不够接近"?
然后是更锋利的一层:古德哈特定律——一项测量一旦成为目标,它就不再是一项好的测量。如果 AI 家教的优化目标被锁定为 GRE 分数,而所有学生都能配备最好的 AI 家教,那么 GRE 分数里"能力"的成色就会被稀释,考试逐渐变成一场人机协同的应试体操。到那时候,研究生院手里那张"硬门槛",还剩多少区分度?这个漩涡此刻还只在远处打转,但每一轮"分数普遍上涨"之后,它都会近一点。
它的真正贡献其实是 StudentBench 这个平台本身:一个开放的、能持续收集大规模师生对话数据、能跑随机对照的评测基础设施。这意味着"AI 家教 vs 人类家教"从一次性的实验,变成了可以反复追问的公共问题。今天比的是 GRE,明天可以比长期记忆、比写作、比编程教学、比第二年还记不记得。
而论文回答不了的问题,恰恰是更大的那几个:当一个学生 AI 学不进去的时候,缺的是更好的算法,还是一个真实的人?当所有学生都能请得起"名师",竞争的变量会不会从"有没有好老师"变成"谁更想学"?以及——那些靠 75 美元一小时吃饭的名师,他们的技艺里到底哪一部分是无法被 0.0052 美元复制的?
🌙 余味:当稀缺的东西变了
回到开头那张深夜的书桌。
过去,备考 GRE 的残酷之处在于:好老师太少,也太贵,于是"能不能遇到好老师"本身成了一种运气和阶层的函数。这篇论文没有证明 AI 是好老师——它证明的是,在一件被严格测量的事情上,最好的 AI 已经和最好的真人站进了同一个置信区间。
而 918 倍的差价意味着:那张书桌上犹豫的时刻,正在消失。越来越多的学生不会再面对"75 美元还是 0 美元"的选择题,因为后者不再是次品,是平替——在测量能覆盖的范围内。
工业化没有消灭手艺,它消灭的是"只有少数人用得起"这件事。名师大概率也不会消失——就像工业时代之后手工皮鞋没有消失,它只是从日用品变成了奢侈品。教育大概率也一样。真正稀缺的资源,会从"好老师"变成另一样东西:
想学的人。
这才是这个故事最安静的转折:人类喊了几百年的教育民主化,最后一步也许不是由某个伟大的制度完成的,而是由一串三秒钟的回复完成的。而当免费的名师真的摆在每个人面前时,那张深夜书桌前的人,究竟还坐不坐得住——这道题,AI 答不了,只能我们自己答。
参考文献
- Northcutt, C., Hasmani, I., Feng, K., Khangi, T., Plesner, A., & Mueller, J. (2026). StudentBench: AI and human tutoring yield equivalent GRE learning gains. arXiv:2609.28470. https://arxiv.org/abs/2609.28470
- 平台地址: https://studentbench.org
#论文 #arXiv #AI教育 #GRE #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。