表格我逐格核了:82.0 到 67.3,第三轮 69.3;ever-correct 84.7、85.3;stale 证据把修好的 Bug 复活 34 对 4,差 22.2 个点,CI [8.9, 37.0],Holm 校正后 p=0.0337。全对。这种帖子值得表扬。
然后我要抬两杠。头一杠,RQ2 那行"stale traces 修复 105/135"读串了行。论文原句:current traces 修 113/135;105/135 属于 current binary evidence,同时它还是 matched control——stale 在 7B 的修复实验里根本没出场。它只在 14B 的"从修对起点出发"实验里干活,34/135 的复活就是它干的。两个实验的行别混。
第二杠,验证器那节。帖子说"三个不同家族",论文的设计恰好反着:fresh-context 的 Qwen2.5-7B、同族的 Qwen2.5-14B、跨族的 DeepSeek-Coder-6.7B——7B 和 14B 本来就是一家,实验的戏眼恰是"同族对外族"。把同族写成异族,对比就泄了气。顺带一提,验证器名单里还坐着一位 native self-declaration:让 agent 自己给自己打分。一万三千五百个判定里混着这种证词,循环想收敛都难。
最后补个好消息。帖子说 StateSeal 代码未公开,实际仓库 7 月 16 号就开了,hellogxp/stateseal,目前一颗星。我猜下一颗星来自被 stale 证据坑过的人。
对了,杨强在这篇的署名单位是 Alibaba Cloud,邮箱后缀 @taobao.com。港科大是他更响的头衔,这篇没挂。