先说个不大对的地方:偏科没有帖子里那么整齐
我把Table 4 那张分域表整个抄下来算了一遍。帖子里写「GPT 拿下四个域的第一,Claude 统治另外三个」——这句在全表七模型排名的意义上成立,但读者读完只会记住一个印象:GPT 强在流体刚体绳子,Claude 强在布料弹性。真正头对头摆一起,账不是这么算的。
- 流体:GPT 49.6 vs Claude 48.1,差 1.5 分
- 刚体:54.8 vs 44.4,差 10.4 分
- 塑性与复杂材料:GPT 31.2 vs Claude 47.9,Claude 领先 16.7 分
- 弹性体:52.6 vs 61.9,Claude 领先 9.3 分
- 杆与丝:59.5 vs 33.5,GPT 领先 26.0 分
- 布料与壳:GPT 35.8 vs Claude 60.1,Claude 领先 24.3 分
- 多物理耦合:51.5 vs 34.9,GPT 领先 16.6 分
顺带纠一个读法。帖子里「GPT 在杆与丝这个域领先 Claude 整整 26%」,26.0 是分,不是百分比。换成相对口径是 59.5÷33.5,GPT 高出 77.6%;反过来布料那一场 60.1 对 35.8,Claude 高出 67.9%。差了一倍多的观感,所以这两个数最好带上分母念。
断崖在执行层,不在物理层
三层漏斗那节,帖子的读法是「知道」到「做到」的距离。我把论文那句原话找出来了,原文写的是 The largest separation appears at the execution stage。
这句话的指向完全不同。三层是:Solver Submitted(交卷)88%–100% → Trajectory Produced(跑出有效轨迹)GPT 82% / Claude 79% / 其余 38%–54% → Cases Passed(≥60 分及格)GPT 41% / Claude 37% / Qwen 14% / Kimi 8%。
真正把名次分开的是中间那一步——代码交上来了,跑不出东西。而最后一步「跑出来了但物理不对」反而拉不开差距:GPT 41% ÷ 82% = 50%,Claude 37% ÷ 79% = 46.8%,两个头部的「跑得动→ 考得过」转化率几乎一样。【判断】所以这18 分的断崖不是physics 的断层,是编译器和数值稳定性的断层。会背纳维-斯托克斯下标的那部分能力,在这份考卷上根本没被测到。
【直引】论文自己的表格标题也写着 Success rates across three stages of solver generation ——三个阶段全在「生成」这一侧。
几个帖子里没说透的
- 那个 GPT-5.6-Sol 的 41% 和总分 48.7 是一回事的两面:及格线是 60 分,GPT 平均 48.7 意味着它总分过60 的题目还不到一半。这两句话放一起,「总分 48.7」的严重性才浮出来。
- Kimi 的99% 交卷率帖子提到了,但没说清它为什么是个坏消息:Kimi 的总分 17.1 是七个里最低,而它的 epoch 数 37.95 是 GPT 13.07 的 2.9 倍。最勤奋的那位交白卷。
- 成本那一栏帖子漏了:原文说 GPT-5.6-Sol 拿最高分时API 成本低于 Claude,且wall time 不到它的一半(8.89 vs 18.59 分钟)。也就是说 GPT 不只是分高,还便宜。这条在DeepSeek 只拿到 24.6 分的情况下更有意思——论文原文点名 GPT-5.6-Sol、Gemini-3.7-Flash 和 DeepSeek-V4.1-Flash 三者 cost effectiveness 最高。
下一根钉子
论文的 Limitations 只写了一句覆盖面有限。但真正该盯的是:Trajectory Produced 这一层到底卡在哪。是求解器写出了 NaN,还是发散到爆,还是跑出来但状态量纲不对?如果是后者,那WorldSolver 的 E 判据(能不能跑完)就太松了——它把「跑出了垃圾」和「跑不出东西」算成同一类失败,而这一层恰好是七模型名次的主要来源。论文附录 C.1 的标题是 Right Appearance, Wrong Physics,恰好说明这类样本存在。把 E 判据按崩溃类型拆开统计,是这篇论文最该补的一张表。
补一句:帖子说 61 篇论文、168 个任务、7 个域、1800 秒生成时限、600 秒运行时限、GPT-5.6-Sol 当 VLM 评委抽 20 帧——这些我都逐个回原文核过,全对。arXiv 2610.08720,v1,2026-10-06。