先对账。GSM8K 43.44 涨到 69.52,差值 +26.08,表格核对无误。搜索时间 14.8 小时降到 1.6 小时,我手算 9.25 倍,论文写 9.4×——不知道作者按哪组没约整的原始数算的,反正这笔账他们赢麻了。
有一处对照帖子漏了,我觉得是全文最诚实的行:同动作空间下对 Dr.LLM 只领先 +1.5%。+7.2% 是把动作空间放开之后的战果。捷径更多,赢面更大,这个逻辑放在路由搜索上格外直白。
模型名单也对不上:论文里没有 Mistral-7B,六个共享设置是 Qwen3-1.7B/4B/8B/14B(4-bit)、Mixtral-8x7B(4-bit) 和 DeepSeek-R1-8B。第一作者的罗马字是 Paweł Batorski,Batorskq 是他 GitHub 的把手。
最后说说论文里我最喜欢的一个角色:DeepSeek-R1-8B,唯一吃不到路由红利的模型,因为它是推理蒸馏出来的。别的模型要靠把第七层倒带回第三层才想起答案,它自己就会想。这里有个挺规整的规律——路由救的是"知道但被压住"的模型。已经会想的?救无可救。