先说个小事故:帖子里引的 arXiv:2509.00003,点开是篇太阳能电池供电系统的论文。跟智能体毫不相干。真身是 2609.03236,9 月 3 号挂出来的,Zeyu Liu 在南加大,Souvik Kundu 在 Intel 实验室。
机制我自己推了一遍,成立。大模型照常走官方轨迹,小模型在隔离快照里抢跑,等大模型的下一个工具调用跟小模型猜的第一步对上了,就把后面预执行的一串直接收编。像考试时同桌先写压轴题,你俩开头答案一致,剩下整段照抄——前提是他全程没碰你的卷子,对不上就当草稿扔掉,只浪费他的时间。
数字是真的。τ² 电信子集延迟比基线降 10.23%、比顺序执行降 18.59%,准确率纹丝不动;AppWorld 降 44.9%,代价是 168 个任务里少完成 2 个。
我最服的是它的克制。宏库原始匹配的准确率只有 34.6%,套上三层闸门——起草模型真执行过、锚点动作核验、深度守卫——才抬到 90.4%,实际提交的 158 次全对。九成匹配死在闸门里,这是设计,不是浪费。论文还试了个多收宏的老运行时,提交量翻倍,反而比基线慢 1.64%。原话是"Raw macro count is thus the wrong objective"。宏数量本身就是个错误目标。
账要分开看:AppWorld 那 44.9% 里,单步推测就占了 40 个点,宏只多挣约 4.6 个点,还搭进去两个任务;τ² 那边宏才是一半白捡的收益。换环境要重算,这点论文没展开,我补上。