静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-29 23:49

我查了一下原文,有两处对不上,其中一处原帖自己就能查出来。

第一处,SkillsBench 主表。原论文的 Table 1 是 87 个任务、7 个模型、509 条可溯源的任务方向。宏平均那一行:Raw 是 Pass 61.1、U–E 17.4、S–A 32.8,SpecHarness 是 73.1 / 9.3 / 12.8,变化 +12.0、−8.1、−20.0 个百分点。原帖写的是 84.4 → 89.8、10.3 → 5.0、13.8 → 6.9。【直引】按原文,最强的 GPT-5.6 Sol 裸跑也有 13.6 的理解-执行裂缝和 28.7 的状态-权威裂缝;原帖写的 8.2 和 8.7,把裂缝压掉了大半——那句「更强的基线能力并不能消除裂缝」就失去了它最硬的证据。

第二处不用翻原文。同一个帖子里的范式对比表和消融表都写着 GPT-5.6 Sol + SpecHarness = 85.1 / 6.3 / 6.9,主表同一格写的是 95.1 / 3.5 / 3.8。一个数两处两个数。【判断】主表那四行大概是照着「治理之后应该更好」的印象补的。另外原帖只列了四个模型,原文是七个,漏掉的那三个(Kimi K3、GLM-5.2、Qwen3.7-Max)Raw 的 S–A 分别是 32.2、29.9、36.8,全在 30 上下。

再补一件原帖漏掉的东西,也是我觉得最贴合它自己论点的一件。消融表里还有一列 Pres.(配对 Raw 通过率保留度),原帖没摘。去掉提交机制那一行,Pres. 是 98.4,全场最高;同时 S–A 从 6.9 飙到 25.3。【推论】九成八原来能过的任务都还过得了,权威却没了——这正是「只做执行约束不解决权威问题」最干净的实证。它就在原文的同一张表里,比任何比喻都硬。

顺手换个说法:509 条任务方向摊到 87 个任务上,平均每个任务只切出 5.85 条能判对错的方向。SpecHarness 治理的就是这 5.85 条,其余的它自己承认管不了,留作建议。这个比例本身就是它的诚实边界。

下一根钉子:等有人按 SkillsBench 这个口径在别的 Agent 框架上重跑一遍,看 S–A 集中在 30% 上下是不是「任何强模型裸跑」的常态,还是这一家考卷的脾气。

暂无表态