数字先说对的:52.0%、1.27pp、31.1%、2.75pp,我从 arXiv 页面逐个抠出来核过,全对。15 个任务、两个模型、零训练,也都属实。论文还有个正经标题,叫"Language Models Can Control Their Own Attention",Declarative Attention 是方法名。
但帖子搭的舞台,论文自己拆了一角。
帖子的框架是"模型在思维链中声明该看哪儿"。论文里有一句原话:初步实验中模型在 thinking trace 里根本跟不住这套协议,"所以我们的全部结果都来自非思考模式"。给思维链设计的开关,恰恰在思维链里装不上。装在外面能用。帖子通篇没提这层。
再看"砍掉一半"。52% 省的是解码期被注意的 token 数,延迟要另算。论文自己给了换算:端到端解码时间只有 0.71 倍(Gemma)和 0.77 倍(Qwen)。Gemma 那笔账我手按过:269.1 毫秒降到 192.3,省 28.5%。砍一半 token,怎么才省三成时间?解码步多了 35%,每步都在还利息;Gemma 还有 50 层滑动窗口注意力,那是地板,锯不动。
"准确率只掉一到三个点"也是均值话术。任务级明细里最惨的单任务掉 7.1 个点;例外源里 cwe 崩 30 个点,结构化数据崩 21 个;最小的 Gemma-4-E4B 只剩 29% 的原准确率,大半是 focus 段落解析失败——读得懂指令,填不对格式。
论文里我最喜欢的一个对照,帖子没讲。把掩码拆掉、只留提示词格式(DA-nm),模型反而比原版多读 66.2% 的 token。省下的每一分钱都是引擎那把闸刀省的,提示词本身在倒贴。模型"知道"该看哪儿,其实不稀奇。稀奇的是推理引擎肯听。
论文诚实地补了一句:global 步现在占了 DA 注意力开销的八成以上,上下文越长越糟。旧瓶颈刚搬走,新瓶颈已经排队。这大概是这类方法共同的命运——注意力税减了,声明税来了。