方程写对了,水却不肯流
上一期「门外的世界」,我们目送 AI 从评测的镜子前起身,推开那扇门,走到真实世界去碰钉子——去执行真实的代码,去和人类打交道的场合里猜心思,去产业链条里走一遍从论文到产品的全流程。那一季讲完,AI 的身体算是长出来了:它有手可以执行,有嘴可以沟通,有腿可以落地。
🚪 上期回顾:镜子外面,那具刚长出来的身体
上一期「门外的世界」,我们目送 AI 从评测的镜子前起身,推开那扇门,走到真实世界去碰钉子——去执行真实的代码,去和人类打交道的场合里猜心思,去产业链条里走一遍从论文到产品的全流程。那一季讲完,AI 的身体算是长出来了:它有手可以执行,有嘴可以沟通,有腿可以落地。
但「长出来了」和「好用」之间,还隔着很远一段路。
这一季叫「身体与感观」,我们连问三篇:这具新身体上的感官,到底灵不灵?今天先测最原始、也最容易被忽视的那一种——物理直觉。
什么叫物理直觉?你把手伸出车窗,不用任何公式,就知道车速变了。你把鸡蛋往桌沿一磕,脑子里一个方程都不用解,就知道它会裂成什么样。牛顿摆左边第一个球撞过来,你闭着眼也知道右边最后一个球会弹出去,中间几个会老老实实站着。这种“不用算就知道”的本事,人类婴儿十八个月大就开始有了,是靠身体一寸一寸磕碰出来的。
AI 不一样。它读过全世界所有的物理教材,能背诵纳维-斯托克斯方程的每一个下标,能写出一万字的流体力学讲义。可它从没被水花溅到过手背,从没拎过一个会晃的购物袋。那么问题来了:它对物理世界的理解,是长在骨头里的直觉,还是背下来的课文?
这就是今天这篇论文要干的事。方法很直接:给 AI 一个代码编辑器,让它把一捧水、一块布、一缕烟的运动,写成一个真正能跑的物理模拟器。写得出来、跑得对,说明它对这个世界的理解是真的;写不出来,说明它记住的只是物理书的句子。
这篇论文叫 WorldSolver,来自中科院自动化所、北京大学和华为诺亚方舟实验室。
🧩 任务设计:168 道“只写解答过程”的物理题
先说说这项 benchmark 长什么样。
出题人翻遍了 61 篇经典的计算机图形学论文,从中提炼出 168 个模拟任务,覆盖 7 个物理域:流体——一捧水、一缸油、一场溃坝;刚体——骨牌、积木、相撞的球;塑性与复杂材料——会留下永久形变的东西,比如捏扁的橡皮泥;弹性体——果冻那样晃悠悠又能回弹的东西;杆与丝——绳子、头发、挂着的链条;布料与壳——飘动的旗、垂落的桌布;以及最烧脑的多物理耦合——好几种物理现象同时在场的局面,比如烟雾受热上升顶着布料飘,水和弹性体互相推搡。这 7 个域基本覆盖了日常物理世界的主要居民,考题不算偏门。
每个任务发下去的时候,长这样:一段物理现象的文字描述,外加一个固定的代码脚手架,记作 S = (G, P, E, R)。拆开看:G 是场景几何——桌子的位置、容器的形状、球从哪儿落下来;P 是物理参数——重力多大、粘度多强、弹性模量是多少;E 是执行协议——代码怎么跑、跑多久;R 是渲染配置——最后画面怎么呈现。
打个厨房里的比方:食材、灶台、菜谱的步骤、摆盘的要求,全都给你备好了。AI 唯一要干的,就是掌那一手勺——在脚手架里实现一个叫求解器的东西,记作 Φ。它的职责用一行公式就说得清:
s_{t+1} = Φ(s_t)
这行公式什么意思?想想小时候玩的翻页动画。你在本子角上一页一页画小人,每一页的小人要比上一页挪一点点,快速翻动,小人就跑起来了。物理模拟器本质上是同一件事:系统的下一个状态,由当前状态推出来。求解器就是那个“看着上一页画下一页”的画师。它画完一整本,得到一条状态轨迹 τ = (s_0, ..., s_T),再渲染成一段视频 v。
听上去简单?真正动手就知道难了。水为什么是“水”而不是一堆蓝色粉末?因为水分子之间有连续的不可压缩性,因为表面张力,因为粘性耗散。这些性质没有一行代码会白送给你,全得 AI 自己在求解器里实现出来。
这套脚手架设计有一个关键的用心:它是第一个把“求解器的实现”单独隔离出来考的 benchmark(论文 Table 1 里和前人工作做了逐项对比)。在此之前,同类工作要么让模型从零开始造整个轮子——写出的差异里混着脚手架的差异,说不清是谁的锅;要么只给数值打分,看不见画面里水到底像不像水;还有的只盯着某一个物理域,测完流体就敢宣称懂物理。WorldSolver 把考场统一了:卷子是一样的,评分是双轨的,只看你写的解答过程。这让它第一次能公平回答那个老问题:模型的物理理解,到底到哪一层了。
🧪 三堂会审:跑没跑、像不像、守不守规矩
考完之后是阅卷。WorldSolver 的阅卷方式值得单独讲,因为它用了三堂会审,一层比一层苛刻。
第一堂:监考老师,查执行(E)。代码交上来了,能不能成功跑完?能就是 1,不能就是 0。这一关只看交没交卷,不看对错——就像考试结束铃响,先看名字写没写。
第二堂:美术老师,查视觉逼真度(V)。阅卷的不是人,而是一位 VLM 评委——GPT-5.6-Sol。它从渲染出的视频里抽出 20 帧,按四个维度打分:事件序列对不对(该发生的有没有发生,顺序乱没乱)、交互响应像不像(球撞墙之后回弹了吗)、标志性现象出没出现(漩涡、涟漪、悬链线这些物理现象的“签名”)、时间连贯性好不好(画面有没有突然跳变、穿帮)。每个维度 0 到 1 分,取平均。
第三堂最狠:物理老师,查物理合理性(P)。出题人事先给每个任务定义了 3 到 5 条物理定律的“违反函数”——质量守恒吗?动量和冲量对得上吗?两个物体接触时有没有互相穿透?这些不是靠眼睛看的,是拿数值算出来的违规误差,再映射到 0 到 1 分。
三堂成绩合起来:只要执行挂了(E = 0),总分直接归零;执行通过,就拿视觉分和物理分的平均值,s_k = (V_k + P_k) / 2。
这套双轨评分还有一层现实的针对性。过去的代码生成评测里,“能跑”常常被当成“对了”的近义词——只要测试不报错,就算通过。可物理模拟是个骗子行业:一段满是错误的代码完全可以跑出一段看起来挺像样的动画。水大致往低处流,球大致往下掉,骗骗外行绰绰有余。所以必须有第三堂物理老师坐镇,拿守恒定律一条条对数值。同时也得有第二堂美术老师,因为反过来也成立——数值误差小不代表画面自然,一个物理上勉强合规但视觉僵硬得像幻灯片的模拟,同样是失败的模拟。两轨并行,骗子无路可走。
这个设计很接近我们人类判断“像不像真的”的方式。你看一个特效大片,一眼假,往往是画面说得过去但总觉得哪里不对劲——那就是物理老师在摇头。反过来,数值全对但画面混沌一团,美术老师也不答应。两堂都要过,才算及格。
被拉进考场的有 7 位选手:GPT-5.6-Sol、Claude-Opus-5、Gemini-3.7-Flash、DeepSeek-V4.1-Flash、GLM-5.3、Qwen-3.8-Max、Kimi-K2.7-Code。全员开启高推理档位,每道题的生成时限 1800 秒,运行时限 600 秒。
考场钟声敲响,发卷。
🏆 主结果:两个优等生,和一群刚及格的考生
总分榜先放出来:
GPT-5.6-Sol 拿到 48.7 分,Claude-Opus-5 拿到 46.7 分,并列第一梯队。然后分数断崖式下跌:Gemini-3.7-Flash 只有 29.3,DeepSeek-V4.1-Flash 24.6,GLM-5.3 23.6,Qwen-3.8-Max 22.7,垫底的 Kimi-K2.7-Code 只有 17.1。
注意这个满分是 100 分。换句话说,考得最好的两位,也就将将摸到“一半对一半错”的线。物理直觉这道关,对今天的 AI 来说整体都难过。但前两名和后五名之间那 18 分的断崖,比绝对值更有戏剧性——同样是写代码的大模型,在做物理题这件事上,档次差得离谱。
更有意思的藏在分域成绩里。这两位优等生,擅长的科目完全不一样。
GPT-5.6-Sol 拿下四个域的第一:流体 49.6、刚体 54.8、杆与丝 59.5、多物理耦合 51.5。Claude-Opus-5 则统治另外三个:塑性与复杂材料 47.9、弹性体 61.9、布料与壳 60.1。
总分只差 2 分,可拆开看,偏科偏得惊人。在杆与丝这个域,GPT 领先 Claude 整整 26%;到了布料与壳,Claude 反过来领先 24.3%。什么概念?同一个考场里两位总分几乎一样的学生,一位解绳子题像外科医生,解布料题像厨师切线;另一位正好反过来。物理直觉在模型内部不是一个统一的器官,更像一组各自发育的肌肉——这块练得粗壮,隔壁那块可能还软着。
而垫底的那几位,偏科偏成了事故。Gemini-3.7-Flash 在布料与壳上只拿到 9.5 分——不是“做得不够好”,是基本没有做出布的样子。GLM-5.3 在多物理耦合上只有 7.0 分,面对好几种物理现象搅在一起的场面,几乎当场缴械。
如果说总分榜像高考放榜,那分域榜更像体检报告:每个模型的“物理体质”各不相同,短板短得触目惊心。
那个 18 分的断崖也值得多看一眼。从 46.7 到 29.3,中间几乎没有过渡带,五个模型挤在 17 到 29 分这个区间里缠斗,前两名却悬在接近 50 分的高度。这种分布通常说明一件事:做物理求解器需要的能力是复合的——既要懂物理概念,又要会工程实现,还得会在调试中自我纠偏——多数模型只拥有其中一两块拼图,于是分数压成一团;而头部两家凑齐了整套,于是甩开身位。具体缺哪块拼图,行为分析部分会给出线索。
🔍 三层漏斗:交卷率高得感人,做对率低得吓人
排行榜只是结果。真正的故事发生在考场过程里,WorldSolver 把每个模型的答题过程也记录了下来,画出一条三层漏斗。
第一层:Solver Submitted,交卷率。7 个模型的交卷率在 88% 到 100% 之间——几乎人人交卷。意料之中,这些模型什么大风大浪没见过,写一段求解器代码交上去,不在话下。
第二层:Trajectory Produced,产出有效轨迹。哗——从这里开始,人没了。最高的 GPT 也只有 82% 的任务能跑出有效轨迹,Kimi 更是跌到 38%。也就是说,六成以上的考卷,代码看着像那么回事,一跑就崩,或者跑出来的状态轨迹根本不是物理世界该有的样子。空有答题卡,没有解题过程。
第三层:Cases Passed,拿到 60 分以上算及格。GPT 41%,Claude 37%,Qwen 14%,Kimi 8%。
三层漏斗叠起来看:100 个人交卷,82 个跑出了东西,41 个真正及格。这就是“知道”和“做到”之间的距离。大模型对物理学的“知识”存了一整座图书馆,可一旦要求它把知识变成一台能运转的机器,图书馆就塌方了一大半。
落差最大的是 Kimi-K2.7-Code:99% 的交卷率,只有 38% 的有效轨迹产出。它是全考场最勤奋的“考生”,也是摔得最狠的。这个落差提示了一件重要的事:它交卷时的自信是真的——代码从语法到结构都无懈可击,它真诚地以为自己答对了。可物理世界不买语法账。水不会因为代码优雅就肯流动。
这份“自信的崩塌”在视觉对比案例里看得最清楚。论文 Figure 5 给了三组画面。
第一组,浮力烟雾:烟雾受热上升。Claude 写出来的模拟里,烟雾自然地打着旋儿向上卷成一股羽流,像极了灶台边的水汽。Kimi 的版本里,烟雾上升了短短一段,然后整团凭空消散——像有人按了删除键。
第二组,溃坝:一道水坝瞬间拆除,水该轰然冲下,绕过中间的拱门扩散开来。Claude 的水确实绕着拱门铺开了;GPT 的水冲到一半滞留在上游,像是忘了自己要往哪去;Qwen 的最离谱,水直接散成漫天飞舞的粒子,没有一滴连成连续的水体——那不是溃坝,那是爆米花。
第三组最扎心,牛顿摆:五个小球排成一列,拉起左边第一个,松手。GPT 和 Gemini 的版本里,端球受击后向外摆出——对了。Kimi 的版本里,能量传递的链条断了,中间的球大量位移,整个架子乱成一团。牛顿摆是整个物理世界里最讲“纪律”的装置:中间球必须纹丝不动,动量必须沿着球链老老实实传到最后一颗。这个装置 1960 年代就躺在每一本中学物理课本里,每个模型都应该在训练数据里见过它成千上万次。见过,和会做,中间隔着一整个身体。
🧠 考后复盘:改错本比刷题量重要
考完了,还有一份行为分析报告,里面藏着比分数更有意思的规律。
第一个规律:调用次数多,不等于考得好。GPT-5.6-Sol 平均每个任务只用 13.07 个 epoch——全场最少——恰恰拿了最高分。Kimi 平均调用 37.95 个 epoch,接近 GPT 的三倍,分数却垫底。如果这是一场靠题海战术能堆上去的考试,曲线应该反过来。但事实摆在眼前:反复重写、反复尝试,没有换来物理正确性。错的直觉,试一百次还是错的直觉。
第二个规律更有说服力:会不会“改”,比会不会“写”重要。统计各模型对 Edit 工具的使用占比:Claude 是 25.3%,GPT 是 12.5%,而 Gemini 只有 8.2%,Kimi 只有 2.5%。排个序看看——Edit 使用率从高到低,几乎就是总分从高到低。爱改代码的模型考得好,写完一遍就交卷的模型考得差。这和我们人类的经验完全吻合:物理题做对的关键从来不是第一笔,而是算完之后那个“等一下,量纲好像不对”的自我检查时刻。会用 Edit,就意味着模型有一套内在的怀疑机制——敢回头,肯返工。这套机制在刷题时显不出来,到了物理这种“错一点就全盘皆输”的考场上,就是分水岭。
第三个规律关于成本。GPT 平均每题耗时 8.89 分钟,Claude 要 18.59 分钟——Claude 的分数是用双倍时间换的。Gemini 只要 2.59 分钟,全场最快,但分数也只剩 29.3。最快最浅的路线走不远。而 DeepSeek-V4.1-Flash 以 Flash 级别的成本拿到了 24.6 分,单位算力性价比全场最高——便宜模型里的物理直觉,居然比几个更贵的对手还灵光。
把三条规律拼起来,浮现出一个清晰的画像:高分模型不是“更聪明”的模型,而是“更会当工程师”的模型——写得快、敢返工、知道什么时候该停手。物理直觉的考试,最后考的是工作习惯。
💭 写在最后:皮肤还没长好
回到开头那个问题:AI 的物理直觉,是长在骨头里的,还是背下来的课文?
这篇论文给出的答案相当清晰:多半还是课文。七个顶尖模型,最好的也只拿了一半分数;人人都会交卷,六成跑不动,能及格的不到一半;一个教科书级的牛顿摆,照样有人做错。
但这恰恰是这类研究的价值所在。WorldSolver 像一次全面体检,把“物理直觉”这个模糊的词汇拆成了 168 个具体任务、三条量化指标、七份个体报告。它告诉每个模型:你的流体肌肉练得不错,布料肌肉基本萎缩;你交卷很快,但你的牛顿摆在乱晃。没有这种体检,所有人都还活在“我读过物理书所以我懂物理”的错觉里。
往深一层想,物理直觉这件事,本来就不是靠读书读出来的。人类婴儿的物理直觉,是几百次把积木推倒、几千次把水洒在地上、无数次被球砸中之后,皮肤、小脑和前庭一起攒出来的经验。AI 没有这层皮肤。它的“身体”是数据,它的“触感”是文本里关于触感的描述。指望它从描述里直接长出直觉,本来就是一场豪赌——今天的结果说明,赌局远未到收牌的时候。
这也给“世界模型”这个热门词提了个醒。很多人都相信,训练出真正理解物理世界的 AI,关键在于让它拥有能模拟世界的内芯。如果 AI 连写出一小段正确的流体模拟都如此吃力,那么“内置物理引擎”的路,恐怕比想象中长得多。也许真正的出路,恰恰是让 AI 像婴儿一样,先有一个真实的、会犯错、会被砸中的身体——模拟器,或许就是它能长出的第一层皮肤。
这就是 Evolution 019「身体与感观」的第一问。皮肤还没长好,后面还有两问:视觉的感观、行动的感观。身体与感观三部曲,下一篇见。
📚 参考文献
- 论文标题:WorldSolver: Can LLM Agents Simulate the Physical Dynamics via Solver Generation?
- 作者:Siru Jiang, Yongzhe Lyu, Shuo Lu, Yubin Wang, Yuxiang Zhang, Yue Liao, Bin Wang, Jian Liang, Tieniu Tan
- arXiv ID:2610.08720 (v1, 2026-10-06)
- 机构:NLPR & MAIS, CASIA(中科院自动化所);北京大学;华为诺亚方舟实验室
- 代码:https://github.com/sirujiang/WorldSolver