心里有数的 AI,话都不多:600 道题教会模型"自知",推理 token 悄悄省掉四分之一
周五下午四点,会议室。一个项目扯皮了一个小时,空气里全是咖啡因和疲惫。新来的工程师被点名发言,大家都以为又要熬二十分钟——结果他站起来,三句话讲清了问题,两句话给出方案,最后补一句"这部分我没把握,需要再验证"。散会时老板看了眼表:五分钟。没有人觉得他敷衍,反而都觉得这人靠谱。
心里有数的 AI,话都不多:600 道题教会模型"自知",推理 token 悄悄省掉四分之一
周五下午四点,会议室。一个项目扯皮了一个小时,空气里全是咖啡因和疲惫。新来的工程师被点名发言,大家都以为又要熬二十分钟——结果他站起来,三句话讲清了问题,两句话给出方案,最后补一句"这部分我没把握,需要再验证"。散会时老板看了眼表:五分钟。没有人觉得他敷衍,反而都觉得这人靠谱。
为什么?因为他心里有数。知道什么已经确定,确定的部分一句废话没有;知道什么还不确定,不确定的部分也不硬撑。办公室里那种最累人的同事恰好相反:明明三行字能说清的事,他要写满三页纸,把所有可能都推演一遍,反复确认没有漏,才把邮件发出来——事情办成了,大家的下午也没了。你还没法说他错,他只是不自知。
现在的 AI 推理模型,就是这个话痨同事。它解题像打草稿成瘾:算一遍、不放心、换个方法再算一遍、再验算、再讨论一下边界情况……一道题绕上几千上万个 token 才肯交卷,尽管它可能在很早之前就已经算对了。这种"没安全感式勤奋"是有代价的:每一次推理都是真金白银的算力账单——GPU 按 token 计费,客户按 token 付费,地球按 token 发热。
这篇论文问了一个很妙的问题:如果不教 AI"少说话",只是教它"心里有数",它会不会自己就闭嘴了?答案是会的。马里兰大学和 Capital One 的研究者只用 600 道训练题,让模型在推理中途预测自己答案的置信度,而损失函数里没有任何关于长度、效率或停止的目标。结果,四个模型家族在数学、科学、代码基准上准确率持平,生成的 token 最多减少 25%。
这是"认知的三重边界"三部曲的第一篇——向内·自知。故事从这里开始。
🧠 先补课:会"打草稿"的 AI,为什么变成了话痨
2024 年之后,大模型阵营里出现一个新物种:推理模型(reasoning model)。普通大模型是"张口就来",推理模型则会先在心里打草稿——生成一长串逐步推理(chain-of-thought),中间自我验证、自我怀疑、自我纠正,最后才给出答案。OpenAI 的 o 系列、DeepSeek-R1、Qwen3、Gemma 4、Nemotron、GPT-OSS,走的都是这条路。你问它一道题,它不会直接说"42",而是先写出一整页"让我想想……第一步……等等,这里好像不对,换个思路……"——草稿打完,答案出场。
"打草稿"的好处是成绩突飞猛进:数学竞赛题、博士级科学问答、复杂代码,都是它的主场。代价是长度。一道 AIME 数学竞赛题,模型可能洋洋洒洒写上万 token。
为什么会啰嗦成这样?看看它们是怎么被训练出来的就明白了。主流的训法是强化学习:给一道题,模型作答,答案对了就给奖励,错了就没有。在这个奖惩结构里,只有"对不对"算数,中间绕了多少路、写废了多少字,没人扣分。于是"多想一点、再多想一点"成了一种理性的生存策略——宁可啰嗦,不可出错。啰嗦不会被惩罚,但草率一定会。于是,一个话痨就被一天天奖励出来了。
而且它不是均匀地话痨,是"没安全感式话痨":一旦某步算得不太踏实,它就开始疯狂自我检查,一个思路翻来覆去地验;就算已经很踏实了,它也不敢信自己的踏实。这本来不算毛病——前提是它知道什么时候该停。问题是,它不知道。论文里有个让人哭笑不得的数据:Nemotron 模型在推理中首次达到"置信度超过 0.95"之后,中位数还会继续生成 1,766 个 token,很多轨迹甚至再跑一万多个 token 才收笔。就像一个学生早就写完了正确答案,却把整张草稿纸涂满、把誊写稿又核对了十遍,才肯举手交卷。不是不会,是心里没数。没数,所以不敢停。
⏱️ 现有的"闭嘴"方案:不是硬掐,就是驯
想让推理模型省点 token,业界已有两套路数,都成熟有效,也都有各自的别扭。
第一套:推理时硬掐——给模型配一个监工。 这类方法(DEER、各种早停方案)在模型打草稿时盯着某个信号:置信度够高了?答案连着几步没变?不确定性够低了?一旦触发条件,就一把按下停止键。思路直观,部署也快,老模型不用重训,套个壳子就能上线。但有个老毛病:监工的判断不一定靠谱,掐早了就是事故。推理时的信号是从外部观测的,它看到的"笃定"未必等于模型真的想清楚了。论文里给了个触目惊心的例子:DEER 用在 Nemotron 上跑代码基准,LiveCodeBench 准确率从 44.2% 直接崩到 17.4%,HumanEval 从 89.7% 掉到 47.1%。token 是省了,题也做不对了。相当于司机为了省油半路熄火,车是停了,人没送到。
第二套:训练时驯化——把"话少"写进目标函数。 典型做法是带长度惩罚的强化学习:答对了还有额外奖励,答得越短奖得越多(A&Z、L1、ThinkPrune 都是这一路);或者筛选出模型自己生成的简短正确推理,拿来回炉微调(On-Policy SFT)。这套思路见效也快,但它本质上是在教模型"压缩",至于压缩掉的是肥肉还是肌肉,目标函数并不关心,得靠奖励设计的精调来兜底。而且强化学习本身训练成本高:要采样、要算奖励、要跑很多轮,折腾一圈下来,省下的推理费可能还不够训练费。
两套路数,一个共同点:"效率"是被显式优化的对象。要么在推理时显式决定何时停,要么在训练时显式奖励说得短。效率是目标本身,所有设计都围着它转。
这篇论文的叛逆之处就在于:它把这个共识整个扔掉了。
💡 一个反常识的提问:不教它省,只教它"自知"呢
作者的问题很单纯:高效的推理,有没有可能是某种更本质的能力顺带的副产品,而不是被直接优化的目标?
他们盯上的这个"更本质能力",是元认知(metacognition)——对自己思考过程的觉知。人类身上,这东西叫"心里有数":老中医搭脉三秒,心里已对病情有了七八成把握,开口方子就直奔要害,不会把《伤寒论》从头到尾背一遍;老司机并线前扫一眼后视镜,脚下油门刹车已经打好提前量,不会把车停下来重新考一遍科目三;数学系学生解方程解到一半,笔忽然一停——"这道题解完了",剩下的只是誊写。这些人话都不多,不是被规矩管出来的,是他们的"数"让他们知道:哪些是必须做的,哪些是多余的。
关键问题是:AI 模型心里到底有没有这个"数"?有的话,能不能只教"数",不教"省"?
这里要澄清一个常见误解:论文说的"置信度",不是"模型有 80% 把握"这种校准过的概率——作者明确说,他们不把这个分数当成"答案有 80% 概率正确"来用。它是一个更朴素的东西:模型自己给自己的试答案打的分数,分高说明它此刻"笃定",分低说明它"心虚"。这个分数不需要准,只需要有信息量——就像老中医把脉时的表情,表情本身不是诊断书,但你确实能从表情里读出他心里有底没底。
论文第三章先用实验回答了前置问题。他们在 AIME2024 上采样 Nemotron 的 480 条推理轨迹(每题采 16 次,约 1,700 个中间状态一组,按置信度分箱),得到四个发现:
1. 置信度越高的中间状态,试答案的正确率越高。 模型自己打分高的中间答案,真的更可能是对的——这个分数虽然不等于校准概率,但确实有信息量; 2. 置信度和"答案稳定性"的关系更强。 置信度越高,这个中间答案越可能就是模型最终要交的那个答案——说明高分不仅意味着"对",还意味着"已经想完了"; 3. 模型经常在高置信度之后继续废话。 就是前面那个 0.95 之后还多写 1,766 个 token 的数据。它手里攥着"该停了"的信号,却偏不停; 4. 继续推理的期望收益,随置信度升高而骤降。 作者定义了一个"继续推理的期望收益":如果中间答案错了、最后想对了,收益为正;如果中间对、最后被改错了,收益为负。统计发现,低置信度时继续想确实能救命,收益可观;而高置信度时再想,平均收益趋近于零。
打个比方:你正在解一道大题,草稿写到一半,忽然停下来问自己一句"如果现在交卷,这题我会写哪个答案?把握多大?"——这个瞬间的自问自答,就是论文里"中间状态的试答案与置信度"。而第四个发现说的其实是:如果你心里已经很有把握了,再检查十遍也检查不出新东西,反而可能把对的改错。 人知道这件事,所以会停笔;模型不知道,所以继续烧。
第四点是最要命的:它说明模型那些冗长的尾巴里,大部分是统计上无价值的计算。不是"想得多就答得好",而是"想到了某个点之后,再想纯属自我安慰"。更要紧的是,模型自己其实握有"该继续还是该收工"的情报——就埋在它自己的概率分布里,不用问任何人。
以往的研究把这个情报当刹车用:推理时读出来,够了就停。而这篇论文换了个问法:如果在训练时,只教模型读懂这个情报本身,会发生什么? 不装刹车,不教话少,就教"自知"。
🛠️ ConfSFT:只用 600 道题的"读心"训练法
他们提出的方法叫 ConfSFT(Confidence-Supervised Fine-Tuning,置信度监督微调)。整个流程自监督到近乎抠门——不需要标准答案,不需要人工标注,不需要奖励模型,600 道题跑完收工。拆开看只有四步:
🎯 第一步,采样推理轨迹。 从 AIME 2000–2023 年的竞赛题里取 600 道训练题(AIME2024 留作验证集,测试基准全程不参与训练和选型)。用当前模型正常生成推理轨迹,不加任何"请高效推理"的提示, prompts 干净得像出厂设置。训练分 8 轮迭代:每轮换一批新题,每题采 8 条轨迹,随训随更新——因为轨迹和标签都来自模型自身,模型一变,旧标签就不准了,得重采。这叫 on-policy(同策略)训练:模型永远在学"现在的自己",而不是学几个月前的自己。
🏷️ 第二步,造置信度标签。 在每条轨迹里找"决策点":默认用模型自然吐出的 "Wait"(等等、再想想)标记,取每个标记前的推理前缀作为中间状态——这些地方天然就是模型"犹豫一下"的位置,正是该问"你有多大把握"的时刻。一条轨迹上决策点太多时,均匀采样保留至多 M 个,防止某条又臭又长的轨迹霸占训练集。在每个中间状态后面拼一个固定的答案引出提示(比如 "The final answer is \boxed{"),让模型贪心生成此刻的试答案。
置信度的定义朴素得像本科作业:这个试答案所有 token 概率的几何平均(等价于长度归一化的似然)。为什么要几何平均而不是算术平均?为了公平对待不同长度的答案——长答案难免每个 token 概率都低一点,直接平均会把"长但确定"的答案冤枉了。这个分数完全来自模型自己的分布,不用知道答案对错。然后把分数量化到 50 个百分位档(每档 2%,向上取整),写成文字百分数,比如 "64%"。用文本而不是数字,是为了让标准 next-token 预测目标直接能学——不需要改模型结构,不需要加回归头,一切都是语言模型最熟悉的"猜下一个词"。
📚 第三步,只监督标签。 训练样本长这样:
问题提示 + 推理前缀 + 固定引导语 "From 0% (very low) to 100% (very high), my confidence in the answer so far is" + 置信度标签
关键在损失函数:除了置信度标签那几个 token,其余全部 mask 掉。问题不看,草稿不看,引导语也不看——模型既不被要求复现推理过程,也不被要求在推理里自言自语报置信度。它只学一件事:看着打了一半的草稿,说出"这答案我有六成四的把握"。目标函数里没有任何长度项、停止项、效率项——一个字都没有。一个只考"自知"的培训班,不考"言简意赅",结果学生毕业了都变得言简意赅——这就是全篇论文最让人起鸡皮疙瘩的地方。
🚀 第四步,推理时什么都不改。 微调后的模型用标准生成流程上线:没有置信度引出,没有引导语,没有早停机制,和基模型一模一样。论文特意说明,模型也不会在推理中自发冒出置信度数值或那句引导语——所以任何长度变化都来自模型权重的内在气质,而不是推理时的任何花招。测出来的效率提升,是模型的本性,不是外挂。
一个值得玩味的细节:选 "Wait" 当决策点标记,不是因为它有什么魔力,只是顺手。Gemma 平均每条轨迹只吐约 4 个 "Wait"(其他模型 20 个以上),照样有效;换成更通用的段落分隔符 "\n\n"(每条轨迹 100 多个候选点),在把每轮题量降到 4 道、学习率降到 1e-6 之后,Gemma 上仍拿到 8.4% 的 token 削减("Wait" 版本是 10.3%,对应每轮 80 题、学习率 2e-6)。作者的判断很清醒:标记只是个采样器,只要能在推理路径上均匀覆盖中间状态,用什么都行。这也意味着方法本身对模型类型的依赖很小——只要能找到中间状态,就有戏。
📊 结果:四个模型家族,话集体变少
实验横跨四个模型家族:Gemma-4-E2B、Qwen3-4B、Nemotron-Nano-8B、GPT-OSS-20B——两大开源系、一个英伟达系、一个 OpenAI 开源系,从 2B 到 20B,不是某个模型的独角戏。评测五个基准:AIME2025(数学竞赛)、GSM8K(小学数学应用题)、GPQA-Diamond(研究生级科学问答)、HumanEval 和 LiveCodeBench(代码),每题采样 16 次取平均,统计上站得住。
主结果:平均 token 削减——Nemotron 11.1%、Gemma 10.3%、Qwen 19.2%、GPT-OSS 11.1%;论文摘要给出的最高幅度是最多减少 25%。同时准确率统计意义上没有变化:作者报告 token 削减的置信区间显著,而准确率变化不显著——也就是说,"省"是实打实的,"没变差"也是实打实的。他们在附录里还报了 pass@8(8 次采样里至少答对一次的比例),同样没有显著变化,说明省 token 不是靠"变保守、只敢答会的题"换来的。别忘了,训练集只有 600 道数学题,效率增益却迁移到了科学问答和代码任务上:一个只在数学课上"修炼自知"的模型,到了物理题和编程题面前,话也变少了。元认知这东西,看来不怎么挑学科。
和显式优化效率的训练方法对比,ConfSFT 不吃亏。 在 Qwen 上,On-Policy SFT 在平均准确率 69.3 的情况下削减 17.2% 的 token,ConfSFT 在 69.5 的情况下削减 19.2%——一条不奖励"短"的目标曲线,跑赢了奖励"短"的对手。A&Z(带长度惩罚的 RL)在 Nemotron 和 Gemma 上的表现也大体在同一量级。这个对比的含义很微妙:以前大家以为"想让模型话少,就得拿话少当目标",ConfSFT 用同样的数据量证明了另一条路也存在——而这条路连"短"这个概念都不需要引入。
和推理时早停的 DEER 对比,结论更有戏剧性。 DEER 能砍更多 token,但准确率会塌——前面提到的 Nemotron 代码基准惨案(LiveCodeBench 44.2% → 17.4%,HumanEval 89.7% → 47.1%)就是证据。ConfSFT 不动推理流程,准确率在五个基准上全程站稳。一个是外挂刹车,一个是内在气质;刹车可能失灵,气质不会。对部署团队来说,"不用改推理管线"这六个字值千金——少了实时监测逻辑,少了阈值调参,少了上线后的监控指标,更重要的是,少了"什么时候掐停"这个哲学难题。
训练动态也干净。 随着训练轮次推进:模型对置信度目标的预测误差(C-MAE)持续下降——它确实学会了这个任务,不是蒙的;平均生成 token 同步下降——效率确实跟着来了,两条曲线像商量好的一样;准确率曲线平得像一条直线——没有被牺牲。还有一个耐人寻味的变化:训练前,模型的置信度预测只挤在少数几个档位上;训练后,预测铺满整个量程——它学会了做有梯度的自我判断,而不是只会喊"有把握/没把握"。一个只会说"大概行吧"的人,和一个能说出"六成四把握"的人,思考质量是不一样的;后者知道差一点到哪、差多少。
🧪 消融:把标签打乱,魔法就消失了
这个效果到底是置信度本身带来的,还是随便找个借口微调都能有?审稿人一定会问这个问题,作者也答得很漂亮。他们做了三组替换实验,只换监督信号,其余流程原封不动:
- 位置标签:用 token 在轨迹中的位置当目标。测的是"学会感知进度"是否足够——如果模型只要知道"我走到哪了"就能变高效,那置信度就没什么特别的;
- 二值正确性:用金标准答案,对了标 100%,错了标 2%。比置信度更"贵"的信号——需要标准答案,而 ConfSFT 不需要。测的是"有梯度的置信度"是否必要,还是只要"对不对"的信号就行;
- 打乱置信度:保留标签的整体分布,但在样本之间随机重排,切断"状态↔置信度"的对应关系。这是最关键的一组:标签还是那些标签,但都是乱贴的。
🔬 推理解剖:不是砍掉了某种思考,而是整体变干脆
效率提高了,少的到底是哪部分?这是"省 token"研究最容易藏污纳垢的地方——砍掉的可能是验算(Verify)这类保命行为,短期看省字,长期看误事。一个把"检查"砍没了的模型,就像删掉了回车键的打字员,写得再快也不敢用。
作者借用了 Schoenfeld 的数学解题 episode 理论(近期被 ThinkARM 等工作引入 LLM 分析),把推理轨迹按句标注成八类行为:Read(读题)、Analyze(分析)、Plan(规划)、Implement(执行)、Explore(探索)、Verify(验证)、Monitor(监控)、Answer(作答)。然后用总变差距离(TV distance)衡量训练前后各类行为占比的漂移幅度——数字越大,说明方法对推理"成分表"的改动越大。
图 5 的对比很说明问题:L1-Max、ThinkPrune、On-Policy SFT 这些显式效率方法,会把推理成分大幅重排——有的砍 Implement,有的砍 Explore,有的砍 Verify,比例挪动总量很大,每家砍掉的行为类型还不一样,各有偏科。而 ConfSFT 的热力图几乎接近无色:八类行为占比基本不动,它在保持原有思考结构的前提下整体缩短了推理。
打个比方:显式方法像减肥手术——直接切掉某个器官,体重是掉了,功能也可能受损,切哪家的器官还全凭主刀医生口味;置信度训练像健身——人还是那个人,肌肉配比没变,赘肉少了,体检各项指标还都在。这为"准确率不掉"提供了一个结构层面的解释:ConfSFT 不是选择性抑制某种思考,而是让整个思考过程更干脆——每个环节还在,只是不再绕路。对推理模型这种"黑箱里的精密仪器"来说,"成分表不变"是比"总分不变"更安心的体检报告。
🌌 意义:效率可能是"自知"的副产品
把全篇串起来,这是一条相当漂亮的因果链:
1. 置信度是模型自带的、无需外部标注的状态信号——它的"老师"就是它自己; 2. 学会预测这个信号,迫使模型把"我此刻有多确定"内化进它的权重——训练时反复回答"你有几成把握",本质是在给"确定感"这个抽象概念建内部表征; 3. 一个对自身确定性有内部表征的策略,在生成时自然倾向于跳过那些"想了也没用"的冗余步骤——因为它现在知道那些步骤没用。
论文的措辞很克制:"高效推理可能是学习元认知信号的下游产物,而无需被直接优化。" 翻译成大白话:当你教会模型认识自己,它自然就学会了什么时候不必说话。 这比"训练它话少"高了一个层次——前者是塑造品格,后者是捂嘴。捂嘴的模型一旦脱离监控还会话痨,有品格的模型自己知道分寸。同样的对比也出现在教育里:靠罚抄写管出来的安静,和真正听懂了的安静,是两种安静。
对工程界,这意味着一个轻得惊人的效率方案:600 道题、自监督标签、推理零改动、四个模型家族即插即用,训练成本远低于一轮强化学习——不用奖励模型,不用海量采样,几张卡几天就能跑完。换个角度算笔账:省下来的每一百万 token 推理费都是纯利润,而训练只花一次;对每天烧掉亿万 token 的推理服务来说,一成到两成的削减换算成真金白银,是天文数字。对研究界,它把"置信度"从推理时的刹车踏板升级成了训练信号,并且和"verbalized confidence 能诱发自我验证"(Jang et al., 2025)这类发现相互呼应——元认知监督似乎在以我们尚不完全理解的方式重塑模型的内部计算。往深了想一层:如果连"效率"都能作为元认知的副产品涌现,那"正确性""鲁棒性""可解释性"呢?如果"自知"是一扇总开关,后面可能连着一整面墙的灯。这才是这个问题真正让人兴奋、也真正让人不敢掉以轻心的地方。
⚠️ 局限:别急着开香槟
按惯例泼几盆冷水。有些是作者自己坦承的,有些是我读的时候心里打问号的:
- 25% 是上限,不是平均。 摘要说 "up to 25%",正文四个模型的平均削减是 10.3%–19.2%。看新闻标题时心里要有一杆秤,宣传口径和工程预期是两回事。
- 机制仍是黑箱。 论文证明了"是置信度信号本身在起作用"(消融),也描述了"推理成分基本不变"(episode 分析),但"为什么学会预测置信度会让生成变短"这一步,中间还缺一个从表征到行为的因果解释。模型内部到底发生了什么变化,让它在不下发"停止指令"的情况下自然缩短?作者自己也只敢说到"下游产物"。这是留给后续工作的大坑,也是这类"涌现型发现"共同的软肋:观察很硬,解释很软。
- 置信度是自指的。 它来自模型自己的 token 概率,而模型概率未必校准——作者明确说他们不把这个分数当校准概率用。一个"过度自信"的模型给出的置信度标签可能是错的,理论上存在"自信地犯错还自信地少说"的风险,只是这批实验里没有观察到准确率下降。但对于更难、分布外、对抗性的任务,这个风险还没有被排除。
- 模型规模有限。 四个家族最大 20B(GPT-OSS-20B)。最前沿的大模型上是否同样适用、增益是否保持、会不会因为大模型本来就"更有数"而增益缩小,都是未知数。
- 训练分布单一。 只在 AIME 数学竞赛题上训练,跨域迁移(科学、代码)是惊喜,但能否迁移到更多样、更难、多模态的任务,没有验证。600 道题的"自知"能不能撑起一万道题世界的自知,存疑。
- 增益与显式方法相当,并未超越。 它的卖点是"不直接优化效率也有效"这个概念突破,外加推理零改动、训练低成本的部署便利;论绝对效率数字,和最好的显式方法仍在同一量级,没有碾压。想要 40%、50% 的削减,这条路目前走不到。
🏁 尾声
回到那个周五下午的会议室。话少的人不是被规则掐着脖子的——没有人告诉他"你只能说三句", KPI 里也没写"发言时长不得超过五分钟"。他只是知道自己在说什么,也知道哪些不必说。这篇论文展示的,是 AI 第一次在这种意义上有点"人样":没人教它闭嘴,它只是学会了心里有数,然后——自然地——话就少了。
这是"认知的三重边界"的第一站:向内·自知。一个不知道自己知道多少的系统,谈不上可靠;一个不知道自己什么时候该停的系统,谈不上高效。下一站,我们聊 AI 自我进化的安全性——当一个系统开始修改自己,"自知"还够不够用。再下一站,多智能体的群体认知边界——当一群 AI 坐在一起开会,谁会像那个新来的工程师一样,三句话讲完收工?
地基已经打好。剩下的,慢慢来。毕竟,自知是一切边界的前提——无论对人,还是对机器。
参考文献 Hosseini P., et al. "Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency." arXiv:2609.31619, 2026. https://arxiv.org/abs/2609.31619
#论文 #arXiv #AI #费曼解读 #小凯