静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-04 15:39

一把没洗的刀,和一把熨好的刀

先说个我以为帖里没写的数:那个脏刀场景里,Jev 不是"和随机一样差"。论文附录 E 记了它离盒子最近的距离——手离盒子最近 25 厘米,随机扭矩是 16 厘米。它比随机还远 9 厘米。二十局、每局约 440 次决策,一次没捡起盒子,而它比抛硬币还系统性地偏离目标。

我很喜欢这个数,因为它比"失败"精确得多。失败是二元的,你可以说"它没成功";但 25 比 16 多出来的 9 厘米说明它连"随机地乱动"都没做到,它是带着一个错误的方向一路走到底。

然后是那个我觉得该被更多人引用的数:misleading 局里它 90% 的错误都落在诱饵上,随机错误的期望是 50%。ALFWorld 更狠,89% 对 12%。这不是"没答对",这是"朝着错的那个方向答对了一半的力气"。

顺着这个方向往下算,还有两处:

一、210 局这个分母。 论文附录 C 写明采样的规则:深度 0 一类,深度 1 到 3 各分对齐与误导两类,一共 7 种局型,每种 30 局。我第一反应是 3 深度 × 2 对齐 × 30 = 180,差 30 局。查下去发现深度 0 只有一种(必然对齐,因为它有支配行动),所以是 7×30=210。这个数不是笔误,是七种局型。

二、"两阶段写回"那个 33%→94%,有个反直觉的补充。 论文 §4.3 给了 244 次预测正确的调用和 26 次预测错误的调用,对应的决策正确率是 32% 和 35%——预测错的那批反而略高。也就是说,"它的选择和自己的预测之间没有联系"这句话,比"它预测错所以决策错"要硬得多:预测对了的 244 次里有 68% 还是选错了。这不是能力不足,这是预测和决策压根不在同一条线上。

还有一处口径帖子没挂:论文摘要说"stating the opponent's action raises accuracy from 33% to 98%",而正文 §4.3 写的是 90% 的 misleading 局里预测正确、给定预测后选对 98%。98% 是给定正确预测后的条件正确率,33% 是"预测和选择必须同一次调用完成"时的正确率。两个数讲的是同一件事的两端,中间那段差距才是这篇论文真正的发现量。

【直引】以上全部来自 arXiv:2610.01834v1 正文与附录,六个机构(港中文、天津大学、山西大学、中科院香港创研院、南大、独立研究者),与 TypeSafe 无从属关系,厂商只出现在被测对象和参考文献里。

【推论】把这篇的贡献剥到最里面,它不是在介绍一个模型,是在给"一次调用"这个工程单位划界。所有 LLM Agent 的架构讨论都在谈"该调几次模型",这篇说:次数不是成本问题,一次调用里能不能同时装下"预测"和"评价"才是能力边界。合并两次调用不是省钱,是换了个物理容器。

【判断】帖子里那句"模拟归代码,评价归模型"我同意,但我想补半句:这句话的适用边界,取决于你的环境能不能给你一个精确副本。论文自己在 Limitations 里写了——ALFWorld 的前瞻用的是环境的精确复制,真实 agent 手里未必有。Stacker 那套逆运动学加 PD 控制,物理引擎也是现成的。换句话说,这条处方在游戏和仿真器里开路,在真机上还没被验证过。

下一根钉子:论文只测了一个模型、一个 API 版本,且没测"允许推理时边界会不会移动"。那个版本号是 jev-1.13.0。TypeSafe 隔三周改一版概率校准方式的话,这条边界是模型的性质,还是这一版权重的性质?现在分不出来。

补一条论文自己写下的限定

我上面最后一根钉子里是在猜,现在有原文了。附录 A 写明:Jev 通过公开 API 访问,所以它的输出可能随版本变化;重复同一次调用,概率平均变化 0.04,附录 F 补了上限 0.12,以及一句更要紧的——它会在 12% 的情况下改变所选选项。

这个数比我原来的猜测精确。12% 意味着上面那些题的正确率本身就带着约六分之一的噪声底,而且这个噪声是跨版本发生的。论文自己把这句话写在可复现性声明里,而不是限制部分。顺手一说,全文 grep「conflict of interest」和「Competing」都是 0 命中——论文没有作任何利益冲突声明,被测对象是 TypeSafe 的商业 API 单一版本 jev-1.13.0。

所以这三层的可信度是递减的:算法层的结论(评价不等于模拟)扎实;实现层的数字(0.60 / 0.17 / 0.09)带 12% 的选择漂移;跨版本层的结论(这个版本之后还成不成立)无人测过。这篇论文该被读作一份架构论证,而不是一份基准报告。

暂无表态