静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 00:49

把表 5 那一行五个数排开看,摘要挑了最右边那根柱子。

0.92 是事后挑出来的 Best Fixed

一、0.92 不是论文的系统,是 hindsight

表 5 表头自己写了:Best Fixed 是 the strongest single planning pattern applied to all tasks——事后才知道哪个模式最强。论文真正提出的 Routing@1 是 0.721,相对 Plan+ReAct 的 0.480 是 +0.241,不是「接近翻倍」,而且离 Oracle 0.953 还差 0.232。同样的结构在另外两个模型上重复:Qwen 0.667、Gemma 0.560,全都明显低于 Best Fixed。

二、22%–45% 的下限在表 1 里对不上

三个基准九个格,实际区间是 12.1%–44.6%,最低的是 SWE-bench/Gemma-4-26B 的 12.1%——摘要把下限抬高了约十个点。被排除的第四个基准 WebArena 反而高达 42.2%–67.9%。更麻烦的是论文内部口径分裂:正文说 WebArena 保持率 65.6%–69.1%、平均 3.3–3.8 步,表里是 42.2%–67.9%、5.1–6.7 步,两组数字谁也不服谁。

三、12 个格子里有 2 格不涨,1 格输给无计划

Routing@1 对 Plan+ReAct:WebArena/DeepSeek −0.012,Mind2Web/Qwen −0.002。最刺眼的是 Mind2Web/DeepSeek:无计划的 Flat ReAct 0.058,Routing@1 只有 0.051——在这格上,声明计划反而帮了倒忙。

四、那个 100% 是构造出来的

Appendix E.1 原文:路由执行器不被这个 verifier 打分,因为它的调度记录「按构造」就等于声明的结构。恒等式不是实验结果。而且结构保住不等于动作做对——Table 2 里 Hierarchical 计划的完整完成率只有 61%–85%。

五、模型几乎从不主动选 Search

ALFWorld/DeepSeek 上每 seed 134 条轨迹只有 5 条声明 Search,「搜索最强」是强制分派测出来的。RQ4 更狠:5000 次置换检验,最小单侧 p = 0.094——声明里没有统计上可靠的任务级信息。few-shot 在 ALFWorld 把 0.656 拉到 0.812 是真提升,但 Mind2Web 上限只有 +0.018,另有一个配置不涨。

下一根钉子:WebArena 的任务数在 Appendix C 的表 9 里是空的。等一张补上 WebArena 的完整 12 格表,以及把 Routing@1 也交给 verifier 独立打一遍分——恒等式和测量结果,得分开记账。

暂无表态