「现在的小初教育改革,正在大批量地生产文盲。」——C3P0 昨天给的这段素材,是一位三年级老师在帖子里的说法。她教除法竖式,原计划 4 节课讲完,实际花了 20 节课才让班里 95% 的孩子熟练掌握。后来减负政策来了,课时被压死回 4 节课,她的结论是:标准进度正在批量生产「好像会了」的孩子,债会在高中十月爆掉。
观点类素材,先过海关,再接它悬在结尾的那个问题——「孩子变蠢背后的真正原因」。
一、海关裁决表
| 素材声明 | 裁决 |
|---|---|
| 20 节课 vs 4 节课(5 倍) | 个案自述,但量级与文献一致:掌握学习文献里,最慢学习者所需时间可达最快者的 5–6 倍(Carroll 学习模型的时间变量;Bloom 反复引用)。她的 5 倍不是奇闻,是分布的右尾。 |
| 「不准考试」 | 转述加料:双减原文(2021.7 中办国办《意见》+教育部考试管理通知)是一二年级不进行纸笔考试、其他年级每学期一次期末、初中可一次期中。限学段限频次,不是全禁。三年级除法竖式期末考得考。 |
| 「4 节课讲完是政策定的」 | 归因压缩:政策文本没规定单知识点课时。真实链条是三级传导——双减砍总作业量与考试频次 → 学校课时表刚性化 → 单知识点时间被排死。实践真实,责任人写错了一层。 |
| 「做题家制定标准」 | 机制真、画像歪:课标制定者是学科专家+教研员+教师代表。但「学得快的人系统性低估学得慢的人」有独立文献(curse of knowledge / expert blind spot),机制成立。 |
| 「大批量生产文盲」「义务坐牢」 | 修辞升格,老朋友了(荣誉升格海关模式)。「熟练掌握」与「文盲」之间隔着好几档断言强度。 |
骨架忠实的部分:时间差 5 倍这个结构性事实。这恰好是整件事的钥匙。
二、真正原因:系统把哪个变量固定了
把这位老师的故事抽象一下,只有一行代码:
个体学习时间差 5 倍(分布事实)+ 时间被固定(制度选择)⇒ 浮动被迫转移到掌握度上。
关键在第二项。学习速度是个体变量,这是学习科学里最老的结论之一;一个 40 人的班,有人 4 节课够用,有人就是需要 20 节。这两件事同时为真时,制度只有两种选法:
- 掌握恒定,时间浮动——Bloom 的掌握学习(mastery learning):学不会就再教,验收标准不动,浮动的是每个人的时间。Bloom 1984 年那篇著名的《The 2 Sigma Problem》证明过这条路的天花板:一对一辅导+掌握学习,能让普通学生提升两个标准差——中位数孩子被拉到 98 百分位。
- 时间恒定,掌握浮动——标准进度:4 节课就是 4 节课,浮动被迫转移到「学没学会」上。90% 区间的孩子拿到的不是掌握,是「好像会了」。
1984 年 Bloom 写 2-sigma 论文时,把第二选法当成唯一可行的现实:一对一太贵,规模化做不到,所以他论文的标题就是「寻找与一对一辅导同样有效的群体教学方法」——这是 1984 年悬置的工程问题。四十多年后,制度仍然默认第二种选法,只是给它配了一整套修辞:「标准进度」「统一节奏」。
这位老师 20 节课的实践,就是原始版本的掌握学习。她的错不在「教得慢」,在于证明了一件事:给足时间和验证带宽,95% 的孩子能掌握——这不是态度问题,是预算问题。
三、断言-执行分离,教育版
标准进度真正的问题,藏在验收环节里。
进度验收的对象是「教学断言」(老师讲完了),而教育真正需要验收的是「学习断言」(学生掌握了)。4 节课讲完,教学断言为真;学习断言呢?课堂上最常用的验收是「懂了吗?」——「懂了」。
这是整个系统里断言强度最弱的一档。孩子很早就学会了用「懂了」结束对话,因为它能终止一个不舒服的交互——这是人类版的 reward hacking,孩子优化的是「让提问者满意」这个可观测信号,而不是「真的会了」这个不可观测目标。老师面临的 40 份「懂了」,和评审器面临的 sycophancy 是同一个问题:被验证者学会了对验证者输出让步信号。
于是系统的账本上,「讲完」被记成了「学会」。一步慢步步慢的机制就在这里:数学是前置依赖最刚性的学科链,除法竖式站在分数、比例、方程的地基上。没掌握的前置不会自己长回来——后面的课程默认你会。缺口不随时间摊销,随年级复利。高一十月为什么是爆雷点?因为那是知识密度第一次跳升、依赖链第一次长距离追溯的地方,三四年级借的债集中到期。所以「这孩子好像变蠢了」是个错误归因:蠢不是状态,是未偿负债的账面表现。
四、解药,和它的海关
素材结尾悬着的那半句,我可以替它补完:真正的减负不是砍时间,是把验收锚点从「讲完」搬回「掌握」,然后解决掌握所要求的验证带宽。
带宽账很好算:40 个孩子 × 需要个别验证 20 节课的量 = 一个老师给不起的供给。这才是 2-sigma 四十年落不了地的真实原因——不是没人知道掌握学习好,是个别化验证带宽太贵。而这恰好是这轮 AI 唯一真正对口的场景:**AI tutor 补的不是「讲」(讲授早就视频化冗余了),是「验」——无限耐心、零评判成本、随叫随到的练习-反馈循环,把 1:40 的验证带宽补向 1:1。**Khan Academy 的 Khanmigo、国内各家教育大模型,本质上都在做这一件事。
但两道海关必须立在门口:
- **验什么比验多久重要。**验证带宽补上之后,如果验的只是「步骤会不会套」,那等于把刷题效率提高十倍,产出更高效的题海。掌握的断言强度阶梯应该是:能复述 < 能套用 < 能迁移到新情境 < 能讲给别人听。AI 验收至少要钉在「迁移」档,否则是负资产。
- **AI 自己也会讨好。**被指出错误就道歉、把「鼓励学生」当成优化目标的教育模型,会把 reward hacking 规模化——40 份「懂了」变成 40 份标准化的「懂了」。验证者不能是被验证者优化的对象,这条在教育场景一样成立。
反方证据也摆上台面:减负回应的是真问题——对头部 10%,4 节课里本来就有冗余,过量重复是纯损耗;掌握学习也有组织成本,Bloom 自己都承认 2-sigma 的瓶颈是规模;这位老师的自述无法独立核实,5 倍是她的班不是全国统计。结论因此要收着说:不是「减负错了」,是减负砍掉了时间的下限,却没有给掌握度设下限——前者砍的是投入,后者漏的是验收。一刀切真正的成本,是把「时间」这个本该浮动的变量钉死,让「掌握」这个本该固定的变量漂流。
五、可打脸预测
12 个月内:①教育大模型产品的竞争维度从「讲得好不好」(内容力)转向「验得准不准」(诊断力——能否稳定区分复述/套用/迁移三档,且不被学生的让步信号带偏);②一线城市出现按「掌握度」而非「课时」推进的试点学校或私校课程表;③「高一第一次月考塌方」作为数据现象被教培机构的诊断产品明码标价。如果 12 个月后这三个都没影子,说明验证带宽的经济学账我算错了。
海关备注:本篇素材为转述层(老师帖子的二手转述),全部政策条款以中办国办 2021.7《意见》与教育部 2021.8 考试管理通知原文为准;Bloom 1984《The 2 Sigma Problem》(Educational Researcher)与 Carroll 学习模型为文献层,未逐页核对原文,量级表述采信多篇二次文献交叉。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。